博主头像

自底向上的芯片设计——Reiner Pope

外来客 • 2026-08-20 02:06:01

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Chip design from the bottom up – Reiner Pope)

🧠 核心概述

AI芯片设计的底层逻辑围绕乘累加(MAC)原语展开,其电路规模与位宽呈二次方关系,使得低精度算术在能效与面积上具备显著优势。传统GPU架构中,数据从寄存器文件移动至逻辑单元的成本远高于计算本身,导致大量芯片面积被浪费在数据搬运上。为突破这一瓶颈,硬件设计需将矩阵乘法的循环逻辑固化,通过提高单次寄存器访问的计算粒度来优化能效。芯片设计的核心矛盾在于计算密度与数据移动开销的平衡,未来趋势是进一步固化高层级循环逻辑,以最大化每比特数据的计算利用率,而非单纯增加寄存器带宽。

🔢 精度、面积与算术基础

  • MAC电路结构:4位乘4位需16个AND门生成部分积;累加8位结果需16个全加器(Full Adder),全加器作为3-2压缩器处理进位。
  • 精度与面积关系:NVIDIA B300及后续芯片中,FP4速度是FP8的3倍(理论应为4倍),因面积随位宽平方增长,低精度更节省空间。
  • MUX成本分析:8选1多路复用器需24个AND门和7个OR门(每比特),而4位MAC仅需4个AND门。数据显示,数据移动成本是计算成本的6倍以上。
  • 架构演进:Volta之前的CUDA核心受限于寄存器文件读写开销;Tensor Core(脉动阵列)通过将矩阵乘法循环固化到硬件,减少了数据移动频率。
  • 低精度优势:低精度(如FP4)不仅提升速度,更因面积二次方缩放特性显著降低硬件成本。

🧮 脉动阵列与计算通信比

  • 矩阵乘法逻辑:矩阵乘法中,每个输出元素对应列向量的点积,涉及多次乘累加操作。
  • 设计目标:在保持 $X \times Y$ 计算量的同时,将寄存器文件间的通信量限制在 $X$ 级别,从而获得随 $Y$ 增长的性能优势。
  • 权重存储策略:权重矩阵在 AI 推理中保持固定,因此直接存储在脉动阵列内部的寄存器中,避免每个周期从外部寄存器文件读取,以节省布线带宽。
  • 滴灌加载机制:权重加载采用“滴灌”策略,通过串行时钟周期将数据逐行移入阵列,利用时间换空间,确保跨边界带宽不超过 $X$。
  • 核心原则:这种架构在芯片堆栈底层(如 ALU 精度)和高层(如多芯片推理)均体现“最大化计算相对于通信”的核心原则。

⏱️ 时钟周期与流水线优化

  • 时钟同步机制:芯片通过全局时钟信号同步所有并行单元,时钟周期由逻辑路径延迟决定,需确保信号在下一时钟沿前完成传输。
  • 流水线权衡:插入流水线寄存器可将长逻辑路径分割,提高时钟频率,但会增加面积开销;这是时钟速度与面积之间的权衡。
  • 反馈回路限制:存在反馈回路(如累加器)时,简单插入寄存器会改变计算语义(如产生奇偶分离的累加和),这是限制时钟周期的最难优化点。
  • 制造差异影响:制造差异导致同工艺节点芯片时钟频率不同,取决于关键路径优化程度。
  • 频率与吞吐矛盾:过度追求高时钟频率会导致面积大部分用于同步寄存器,降低吞吐量,类似低批量推理中延迟低但总吞吐下降的现象。

💻 FPGA 与 ASIC 的权衡

  • 成本与能效对比:FPGA 与 ASIC 使用相同的门级概念模型,但 ASIC 在成本和能效上优于 FPGA 约一个数量级。
  • 首件成本差异:FPGA 首件成本约 1 万美元,而 ASIC 需约 3000 万美元流片费用。
  • 应用场景选择:高频交易等场景选择 FPGA 是因为其确定性延迟、快速运行时和高并行性,适合对延迟敏感且无需大规模量产的应用。
  • FPGA 架构细节:FPGA 由寄存器、查找表(LUT)及大量多路复用器(MUX)组成,通过编程 MUX 控制信号路径实现逻辑功能。
  • LUT 实现成本:LUT 本质是 4 输入 1 输出的真值表,需 16 个存储位,内部实现为 16 选 1 的 MUX,消耗约 32 个门电路。
  • ASIC 效率优势:相比 ASIC 直接实现逻辑门(如 3 个 AND 门),FPGA 实现同等功能需 32 个门,导致其成本约为 ASIC 的 10 倍。
  • 确定性延迟:FPGA 提供确定性时钟周期,适合对延迟敏感的应用,而 CPU 因缓存机制存在非确定性延迟。

🧠 CPU 与加速器架构差异

  • CPU 核心构成:CPU 核心面积主要被缓存、寄存器文件和分支预测器占用,分支预测器用于掩盖指令执行延迟(约 5 纳秒)。
  • GPU 架构优化:GPU 去除了大型分支预测器并优化寄存器文件,从而在相同面积下容纳更多计算单元。
  • TPU 粗粒度设计:TPU 采用粗粒度架构,由大型矩阵单元(Systolic Array)和向量单元组成;GPU 则由大量细粒度 SM(流多处理器)组成,每个 SM 类似微型 TPU。
  • 数据移动带宽:TPU 数据在向量与矩阵单元间通过少量总线传输,GPU 则通过多条并行线路传输,数据移动带宽更高但跨 SM 通信成本增加。

⚡ 能效与生物脑对比

  • 动态功耗主导:芯片能耗主要源于动态功耗(电容充放电),降低时钟频率可减少切换次数,从而线性降低能耗,但不会带来能效的指数级提升。
  • 大脑稀疏性:大脑具有非结构化稀疏性,且时钟频率远低于芯片,以牺牲速度换取能量效率。
  • 设计目标差异:芯片高时钟频率旨在提高吞吐量,而大脑仅处理单一实例(Batch Size 1),两者设计目标不同。

博主头像 👤 同一博主

查看该博主全部 22 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。