自底向上的芯片设计——Reiner Pope
外来客 • 2026-08-20 02:06:01
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Chip design from the bottom up – Reiner Pope)
🧠 核心概述
AI芯片设计的底层逻辑围绕乘累加(MAC)原语展开,其电路规模与位宽呈二次方关系,使得低精度算术在能效与面积上具备显著优势。传统GPU架构中,数据从寄存器文件移动至逻辑单元的成本远高于计算本身,导致大量芯片面积被浪费在数据搬运上。为突破这一瓶颈,硬件设计需将矩阵乘法的循环逻辑固化,通过提高单次寄存器访问的计算粒度来优化能效。芯片设计的核心矛盾在于计算密度与数据移动开销的平衡,未来趋势是进一步固化高层级循环逻辑,以最大化每比特数据的计算利用率,而非单纯增加寄存器带宽。
🔢 精度、面积与算术基础
- MAC电路结构:4位乘4位需16个AND门生成部分积;累加8位结果需16个全加器(Full Adder),全加器作为3-2压缩器处理进位。
- 精度与面积关系:NVIDIA B300及后续芯片中,FP4速度是FP8的3倍(理论应为4倍),因面积随位宽平方增长,低精度更节省空间。
- MUX成本分析:8选1多路复用器需24个AND门和7个OR门(每比特),而4位MAC仅需4个AND门。数据显示,数据移动成本是计算成本的6倍以上。
- 架构演进:Volta之前的CUDA核心受限于寄存器文件读写开销;Tensor Core(脉动阵列)通过将矩阵乘法循环固化到硬件,减少了数据移动频率。
- 低精度优势:低精度(如FP4)不仅提升速度,更因面积二次方缩放特性显著降低硬件成本。
🧮 脉动阵列与计算通信比
- 矩阵乘法逻辑:矩阵乘法中,每个输出元素对应列向量的点积,涉及多次乘累加操作。
- 设计目标:在保持 $X \times Y$ 计算量的同时,将寄存器文件间的通信量限制在 $X$ 级别,从而获得随 $Y$ 增长的性能优势。
- 权重存储策略:权重矩阵在 AI 推理中保持固定,因此直接存储在脉动阵列内部的寄存器中,避免每个周期从外部寄存器文件读取,以节省布线带宽。
- 滴灌加载机制:权重加载采用“滴灌”策略,通过串行时钟周期将数据逐行移入阵列,利用时间换空间,确保跨边界带宽不超过 $X$。
- 核心原则:这种架构在芯片堆栈底层(如 ALU 精度)和高层(如多芯片推理)均体现“最大化计算相对于通信”的核心原则。
⏱️ 时钟周期与流水线优化
- 时钟同步机制:芯片通过全局时钟信号同步所有并行单元,时钟周期由逻辑路径延迟决定,需确保信号在下一时钟沿前完成传输。
- 流水线权衡:插入流水线寄存器可将长逻辑路径分割,提高时钟频率,但会增加面积开销;这是时钟速度与面积之间的权衡。
- 反馈回路限制:存在反馈回路(如累加器)时,简单插入寄存器会改变计算语义(如产生奇偶分离的累加和),这是限制时钟周期的最难优化点。
- 制造差异影响:制造差异导致同工艺节点芯片时钟频率不同,取决于关键路径优化程度。
- 频率与吞吐矛盾:过度追求高时钟频率会导致面积大部分用于同步寄存器,降低吞吐量,类似低批量推理中延迟低但总吞吐下降的现象。
💻 FPGA 与 ASIC 的权衡
- 成本与能效对比:FPGA 与 ASIC 使用相同的门级概念模型,但 ASIC 在成本和能效上优于 FPGA 约一个数量级。
- 首件成本差异:FPGA 首件成本约 1 万美元,而 ASIC 需约 3000 万美元流片费用。
- 应用场景选择:高频交易等场景选择 FPGA 是因为其确定性延迟、快速运行时和高并行性,适合对延迟敏感且无需大规模量产的应用。
- FPGA 架构细节:FPGA 由寄存器、查找表(LUT)及大量多路复用器(MUX)组成,通过编程 MUX 控制信号路径实现逻辑功能。
- LUT 实现成本:LUT 本质是 4 输入 1 输出的真值表,需 16 个存储位,内部实现为 16 选 1 的 MUX,消耗约 32 个门电路。
- ASIC 效率优势:相比 ASIC 直接实现逻辑门(如 3 个 AND 门),FPGA 实现同等功能需 32 个门,导致其成本约为 ASIC 的 10 倍。
- 确定性延迟:FPGA 提供确定性时钟周期,适合对延迟敏感的应用,而 CPU 因缓存机制存在非确定性延迟。
🧠 CPU 与加速器架构差异
- CPU 核心构成:CPU 核心面积主要被缓存、寄存器文件和分支预测器占用,分支预测器用于掩盖指令执行延迟(约 5 纳秒)。
- GPU 架构优化:GPU 去除了大型分支预测器并优化寄存器文件,从而在相同面积下容纳更多计算单元。
- TPU 粗粒度设计:TPU 采用粗粒度架构,由大型矩阵单元(Systolic Array)和向量单元组成;GPU 则由大量细粒度 SM(流多处理器)组成,每个 SM 类似微型 TPU。
- 数据移动带宽:TPU 数据在向量与矩阵单元间通过少量总线传输,GPU 则通过多条并行线路传输,数据移动带宽更高但跨 SM 通信成本增加。
⚡ 能效与生物脑对比
- 动态功耗主导:芯片能耗主要源于动态功耗(电容充放电),降低时钟频率可减少切换次数,从而线性降低能耗,但不会带来能效的指数级提升。
- 大脑稀疏性:大脑具有非结构化稀疏性,且时钟频率远低于芯片,以牺牲速度换取能量效率。
- 设计目标差异:芯片高时钟频率旨在提高吞吐量,而大脑仅处理单一实例(Batch Size 1),两者设计目标不同。
👤 同一博主
瑞安·格林布拉特(Ryan Greenblatt):当AI能够自动化AI研究时会发生什么?
持续学习时代的八项预测
更智能的AI模型或致算力价格飙升10倍
从第一性原理推导广义相对论——亚当·布朗
格兰特·桑德森(Grant Sanderson):AI 证伪著名数学猜想,接下来怎么办?
下一代训练范式是什么样的?
AI 核心的数据黑洞
马基雅维利是历史上最被误解的思想家——阿达·帕尔默
莎拉·佩恩(Sarah Paine):普京与习近平为何无法摆脱地理制约
AI 越强,其在经济中的份额可能越小——Alex Imas 和 Phil Trammell
🧭 类似博主
-
馬斯克:放棄火星?建100萬衛星?掌握耶穌級技術?馬斯克反常舉動曝光:人類與AI的決戰,其實已經打響
-
《人民的珍藏》第三季 寸图倾心筑通衢:两年磨一剑!重庆东站高铁站设计画稿惊艳亮相 中铁二院建筑师的匠
-
巨頭們不敢公開的最新實驗:為什麼科技越發達,失業率越高,人們越焦慮?比末日更可怕的未來正在逼近...
-
方舟子揭假:上海交大做谋财害命的基因疗法
-
美国“末日飞机”的工作原理
-
五角大楼UFO文件公开:外星文明实锤,还是一场精心设计的烟雾弹?
-
人死後,意識會留在更高維度嗎?宇宙是如何膨脹的?意識真的是這個宇宙中事件的一部分嗎?
-
人類明明贏了,為何卻笑不出來?揭開「人類對決AI機器人」的絕望真相,代價太恐怖了!
-
腦神經科學家懷疑:意識不存在於大腦! / 科學正在害怕什麼? / 單一世界觀讓「療癒」卡住了 | 青
-
元宇宙防骗指南
0 条评论
发表评论
请先 登录 后参与讨论。