来客网

一文看懂:芯片架构与算力革命

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

引子:一块“显卡”如何变成 AI 时代的工业设备

今天谈 NVIDIA,人们想到的是大模型训练、万卡集群和数据中心,而不是电脑屏幕上的一辆赛车。可这家公司最初解决的,恰恰是怎样让赛车、爆炸和光影在个人电脑上实时出现。

图 1|从图形芯片、计算卡到机架级 AI 基础设施

两类任务表面不同,数学结构却相似。渲染一帧画面,需要对成千上万个顶点和像素执行相近运算;训练神经网络,需要对海量参数和样本反复做矩阵乘加。两者都依靠大量计算单元同时处理许多相似的小任务。

NVIDIA 的发展可以看成计算单位不断扩大的过程:

早期竞争围绕一块芯片每秒能画多少三角形;CUDA 以后,竞争转向开发者能否方便地调用并行算力;深度学习兴起后,矩阵精度、显存容量和多卡通信成为关键;到了 Blackwell 和 Rubin,供电、液冷、交换网络、编译器和推理软件已和 GPU 本身一样重要。

因此,理解 NVIDIA 计算卡,光记“某代多少核、多少 FLOPS”远远不够。更有用的问题是:每一代架构把哪个瓶颈向后推了一步,又暴露了什么新瓶颈。

0

评论 (0)