显卡工作原理:探索 GPU 架构
外来客 • 2026-08-19 11:19:54
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:How do Graphics Cards Work? Exploring GPU Architecture)
🎮 算力规模与性能基准
- 现代显卡每秒需执行约 36 万亿次计算以运行《赛博朋克 2077》等写实游戏,相当于 4400 个地球人口每人每秒完成一次长乘法运算。
- 对比历史数据:1996 年《超级马里奥 64》仅需每秒 1 亿次计算,2011 年《我的世界》需每秒 1000 亿次计算。
- 以 RTX 3090 为例,其拥有 10,496 个 CUDA 核心,主频 1.7 GHz,理论算力达每秒 35.6 万亿次。
⚖️ GPU 与 CPU 架构差异
- 核心数量:GPU 拥有超过 10,000 个核心,而 CPU 通常仅有 24 个核心。
- 设计类比:GPU 如同巨型货轮,擅长处理海量数据但速度较慢;CPU 如同喷气客机,处理少量数据速度极快且灵活。
- 功能限制:CPU 可运行操作系统、支持网络接口及多样化指令;GPU 仅能执行简单算术指令,无法独立运行操作系统或处理复杂逻辑分支。
- 适用场景:GPU 适合处理“尴尬并行”(Embarrassingly Parallel)任务,如游戏渲染、比特币挖矿及神经网络;CPU 适合低数据量、高延迟敏感及系统级任务。
🏗️ GPU 物理架构与核心层级
- 芯片设计:以 GA102 芯片为例,包含 283 亿个晶体管,划分为 7 个图形处理集群(GPC)。
- 层级结构:每个 GPC 含 12 个流多处理器(SM),每个 SM 含 4 个 Warp 和 1 个光线追踪核心;每个 Warp 含 32 个 CUDA 核心和 1 个 Tensor 核心。
- 核心总数:完整 GA102 芯片含 10,752 个 CUDA 核心、336 个 Tensor 核心及 84 个光线追踪核心。
- 核心功能:
- CUDA 核心:执行基础算术(如 FMA 融合乘加),是游戏渲染主力。
- Tensor 核心:执行矩阵乘加运算,用于几何变换及 AI 神经网络。
- 光线追踪核心:执行光线追踪算法,数量最少但体积最大。
- 分级策略(Binning):3090 Ti、3090、3080 Ti、3080 均使用同一 GA102 芯片,因制造缺陷不同而禁用部分核心。3090 Ti 保留全部 10,752 核心,3080 仅保留 8,704 核心(相当于 16 个 SM 被禁用)。
💾 显存系统与数据传输
- 显存规格:RTX 3090 配备 24 GB GDDR6X 显存,由 Micron 制造。
- 带宽对比:
- GPU 显存总线宽度 384 位,带宽约 1.15 TB/s。
- CPU 内存总线宽度 64 位,带宽约 64 GB/s。
- 编码技术:
- GDDR6X:使用 PAM4 编码,通过 4 种电压电平传输 2 位数据。
- GDDR7:改用 PAM3 编码,通过 3 种电压电平传输数据,旨在降低编码器复杂度、提高信噪比及能效。
- HBM 技术:高带宽内存(HBM3E)通过硅通孔(TSV)堆叠 DRAM,单块可达 24-36 GB,围绕 AI 芯片提供高达 192 GB 的高速内存,功耗比竞品低 30%。
🧮 计算架构与并行处理
- SIMD 原理:单指令多数据(Single Instruction Multiple Data),同一指令应用于数千至数百万个不同数据。
- 游戏渲染示例:将物体从模型空间转换至世界空间。例如,将 5,629 个物体的 830 万个顶点坐标进行加法运算,共需 2500 万次加法,所有计算无依赖关系,可并行执行。
- 线程层级:
- 1 个线程对应 1 个 CUDA 核心。
- 32 个线程组成 1 个 Warp。
- Warp 组成线程块(Thread Block),由 SM 处理。
- 线程块组成网格(Grid),由整个 GPU 计算。
- 架构演进:
- SIMD:Warp 内 32 个线程必须锁步执行(Lockstep)。
- SIMT:单指令多线程(Single Instruction Multiple Threads),线程拥有独立程序计数器,无需锁步,支持分支发散及重新汇聚,共享 128 KB L1 缓存,灵活性更高。
⛏️ 比特币挖矿与 AI 应用
- 比特币挖矿:
- 原理:通过 SHA-256 算法生成随机哈希值,寻找前 80 位全零的“中奖”号码。
- 性能:RTX 3090 每秒可生成约 9500 万个哈希值。
- 现状:ASIC 专用芯片每秒可达 250 万亿次哈希,相当于 2600 张显卡,显卡在挖矿领域已失去竞争力。
- Tensor 核心与 AI:
- 功能:同时接收三个矩阵,执行前两个矩阵相乘后加上第三个矩阵。
- 应用:神经网络及生成式 AI 需执行万亿至千万亿次矩阵运算,Tensor 核心可并发完成这些计算。
👤 同一博主
轻触支付:比简单一触复杂72倍!
microSD 卡如何实现海量数据存储
GPU 是如何用光“打印”出来的
被遗忘的苹果产品:彻底改变计算机行业的 Apple II
计算机缓存、内存与存储是如何工作的?🖥️💿🛠️
计算机的惊人演变
驱动数字世界的工程:CPU 的工作原理
价值2亿美元的微芯片“打印机”:EUV光刻系统
晶体管如何构建CPU?
光线追踪在电子游戏和电影中的工作原理
🧭 类似博主
-
注意!WiFi 的監控能力大增!黑洞質量可能被灌水百倍【泛科學NEWS EP77】
-
[M6版Macmini真有升级必要吗?] 继续持有M4版的升级拓展方法,从存储空间/显示接口DP H
-
iPhone 18 Pro Max 手机壳横评:如何避免选错?
-
2026无限流量机场推荐 | 免费体验 实测2000Mbps/4K秒开 | 支持全平台,奈飞/Gem
-
豆包工作手把手教程,让你工作提效200%!(赠51页橙皮书)
-
比永远更远,核周报 9.19
-
安东·彼得罗夫(Anton Petrov)的真相
-
AppleInsider 播客:iPhone 18 Pro、Apple Watch、iPhone D
-
如何使用 Claude Code 构建 UiPath 编码代理
-
最新iPhone18 Pro系列超详细验机教程 防扯皮、防骗攻略 建议收藏!「科技美学开箱」#iph
0 条评论
发表评论
请先 登录 后参与讨论。