博主头像

显卡工作原理:探索 GPU 架构

外来客 • 2026-08-19 11:19:54

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:How do Graphics Cards Work? Exploring GPU Architecture)

🎮 算力规模与性能基准

  • 现代显卡每秒需执行约 36 万亿次计算以运行《赛博朋克 2077》等写实游戏,相当于 4400 个地球人口每人每秒完成一次长乘法运算。
  • 对比历史数据:1996 年《超级马里奥 64》仅需每秒 1 亿次计算,2011 年《我的世界》需每秒 1000 亿次计算。
  • 以 RTX 3090 为例,其拥有 10,496 个 CUDA 核心,主频 1.7 GHz,理论算力达每秒 35.6 万亿次。

⚖️ GPU 与 CPU 架构差异

  • 核心数量:GPU 拥有超过 10,000 个核心,而 CPU 通常仅有 24 个核心。
  • 设计类比:GPU 如同巨型货轮,擅长处理海量数据但速度较慢;CPU 如同喷气客机,处理少量数据速度极快且灵活。
  • 功能限制:CPU 可运行操作系统、支持网络接口及多样化指令;GPU 仅能执行简单算术指令,无法独立运行操作系统或处理复杂逻辑分支。
  • 适用场景:GPU 适合处理“尴尬并行”(Embarrassingly Parallel)任务,如游戏渲染、比特币挖矿及神经网络;CPU 适合低数据量、高延迟敏感及系统级任务。

🏗️ GPU 物理架构与核心层级

  • 芯片设计:以 GA102 芯片为例,包含 283 亿个晶体管,划分为 7 个图形处理集群(GPC)。
  • 层级结构:每个 GPC 含 12 个流多处理器(SM),每个 SM 含 4 个 Warp 和 1 个光线追踪核心;每个 Warp 含 32 个 CUDA 核心和 1 个 Tensor 核心。
  • 核心总数:完整 GA102 芯片含 10,752 个 CUDA 核心、336 个 Tensor 核心及 84 个光线追踪核心。
  • 核心功能
  • CUDA 核心:执行基础算术(如 FMA 融合乘加),是游戏渲染主力。
  • Tensor 核心:执行矩阵乘加运算,用于几何变换及 AI 神经网络。
  • 光线追踪核心:执行光线追踪算法,数量最少但体积最大。
  • 分级策略(Binning):3090 Ti、3090、3080 Ti、3080 均使用同一 GA102 芯片,因制造缺陷不同而禁用部分核心。3090 Ti 保留全部 10,752 核心,3080 仅保留 8,704 核心(相当于 16 个 SM 被禁用)。

💾 显存系统与数据传输

  • 显存规格:RTX 3090 配备 24 GB GDDR6X 显存,由 Micron 制造。
  • 带宽对比
  • GPU 显存总线宽度 384 位,带宽约 1.15 TB/s。
  • CPU 内存总线宽度 64 位,带宽约 64 GB/s。
  • 编码技术
  • GDDR6X:使用 PAM4 编码,通过 4 种电压电平传输 2 位数据。
  • GDDR7:改用 PAM3 编码,通过 3 种电压电平传输数据,旨在降低编码器复杂度、提高信噪比及能效。
  • HBM 技术:高带宽内存(HBM3E)通过硅通孔(TSV)堆叠 DRAM,单块可达 24-36 GB,围绕 AI 芯片提供高达 192 GB 的高速内存,功耗比竞品低 30%。

🧮 计算架构与并行处理

  • SIMD 原理:单指令多数据(Single Instruction Multiple Data),同一指令应用于数千至数百万个不同数据。
  • 游戏渲染示例:将物体从模型空间转换至世界空间。例如,将 5,629 个物体的 830 万个顶点坐标进行加法运算,共需 2500 万次加法,所有计算无依赖关系,可并行执行。
  • 线程层级
  • 1 个线程对应 1 个 CUDA 核心。
  • 32 个线程组成 1 个 Warp。
  • Warp 组成线程块(Thread Block),由 SM 处理。
  • 线程块组成网格(Grid),由整个 GPU 计算。
  • 架构演进
  • SIMD:Warp 内 32 个线程必须锁步执行(Lockstep)。
  • SIMT:单指令多线程(Single Instruction Multiple Threads),线程拥有独立程序计数器,无需锁步,支持分支发散及重新汇聚,共享 128 KB L1 缓存,灵活性更高。

⛏️ 比特币挖矿与 AI 应用

  • 比特币挖矿
  • 原理:通过 SHA-256 算法生成随机哈希值,寻找前 80 位全零的“中奖”号码。
  • 性能:RTX 3090 每秒可生成约 9500 万个哈希值。
  • 现状:ASIC 专用芯片每秒可达 250 万亿次哈希,相当于 2600 张显卡,显卡在挖矿领域已失去竞争力。
  • Tensor 核心与 AI
  • 功能:同时接收三个矩阵,执行前两个矩阵相乘后加上第三个矩阵。
  • 应用:神经网络及生成式 AI 需执行万亿至千万亿次矩阵运算,Tensor 核心可并发完成这些计算。

0 条评论

发表评论

请先 登录 后参与讨论。