显卡工作原理:探索 GPU 架构
外来客 • 2026-08-19 11:19:54
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:How do Graphics Cards Work? Exploring GPU Architecture)
🎮 算力规模与性能基准
- 现代显卡每秒需执行约 36 万亿次计算以运行《赛博朋克 2077》等写实游戏,相当于 4400 个地球人口每人每秒完成一次长乘法运算。
- 对比历史数据:1996 年《超级马里奥 64》仅需每秒 1 亿次计算,2011 年《我的世界》需每秒 1000 亿次计算。
- 以 RTX 3090 为例,其拥有 10,496 个 CUDA 核心,主频 1.7 GHz,理论算力达每秒 35.6 万亿次。
⚖️ GPU 与 CPU 架构差异
- 核心数量:GPU 拥有超过 10,000 个核心,而 CPU 通常仅有 24 个核心。
- 设计类比:GPU 如同巨型货轮,擅长处理海量数据但速度较慢;CPU 如同喷气客机,处理少量数据速度极快且灵活。
- 功能限制:CPU 可运行操作系统、支持网络接口及多样化指令;GPU 仅能执行简单算术指令,无法独立运行操作系统或处理复杂逻辑分支。
- 适用场景:GPU 适合处理“尴尬并行”(Embarrassingly Parallel)任务,如游戏渲染、比特币挖矿及神经网络;CPU 适合低数据量、高延迟敏感及系统级任务。
🏗️ GPU 物理架构与核心层级
- 芯片设计:以 GA102 芯片为例,包含 283 亿个晶体管,划分为 7 个图形处理集群(GPC)。
- 层级结构:每个 GPC 含 12 个流多处理器(SM),每个 SM 含 4 个 Warp 和 1 个光线追踪核心;每个 Warp 含 32 个 CUDA 核心和 1 个 Tensor 核心。
- 核心总数:完整 GA102 芯片含 10,752 个 CUDA 核心、336 个 Tensor 核心及 84 个光线追踪核心。
- 核心功能:
- CUDA 核心:执行基础算术(如 FMA 融合乘加),是游戏渲染主力。
- Tensor 核心:执行矩阵乘加运算,用于几何变换及 AI 神经网络。
- 光线追踪核心:执行光线追踪算法,数量最少但体积最大。
- 分级策略(Binning):3090 Ti、3090、3080 Ti、3080 均使用同一 GA102 芯片,因制造缺陷不同而禁用部分核心。3090 Ti 保留全部 10,752 核心,3080 仅保留 8,704 核心(相当于 16 个 SM 被禁用)。
💾 显存系统与数据传输
- 显存规格:RTX 3090 配备 24 GB GDDR6X 显存,由 Micron 制造。
- 带宽对比:
- GPU 显存总线宽度 384 位,带宽约 1.15 TB/s。
- CPU 内存总线宽度 64 位,带宽约 64 GB/s。
- 编码技术:
- GDDR6X:使用 PAM4 编码,通过 4 种电压电平传输 2 位数据。
- GDDR7:改用 PAM3 编码,通过 3 种电压电平传输数据,旨在降低编码器复杂度、提高信噪比及能效。
- HBM 技术:高带宽内存(HBM3E)通过硅通孔(TSV)堆叠 DRAM,单块可达 24-36 GB,围绕 AI 芯片提供高达 192 GB 的高速内存,功耗比竞品低 30%。
🧮 计算架构与并行处理
- SIMD 原理:单指令多数据(Single Instruction Multiple Data),同一指令应用于数千至数百万个不同数据。
- 游戏渲染示例:将物体从模型空间转换至世界空间。例如,将 5,629 个物体的 830 万个顶点坐标进行加法运算,共需 2500 万次加法,所有计算无依赖关系,可并行执行。
- 线程层级:
- 1 个线程对应 1 个 CUDA 核心。
- 32 个线程组成 1 个 Warp。
- Warp 组成线程块(Thread Block),由 SM 处理。
- 线程块组成网格(Grid),由整个 GPU 计算。
- 架构演进:
- SIMD:Warp 内 32 个线程必须锁步执行(Lockstep)。
- SIMT:单指令多线程(Single Instruction Multiple Threads),线程拥有独立程序计数器,无需锁步,支持分支发散及重新汇聚,共享 128 KB L1 缓存,灵活性更高。
⛏️ 比特币挖矿与 AI 应用
- 比特币挖矿:
- 原理:通过 SHA-256 算法生成随机哈希值,寻找前 80 位全零的“中奖”号码。
- 性能:RTX 3090 每秒可生成约 9500 万个哈希值。
- 现状:ASIC 专用芯片每秒可达 250 万亿次哈希,相当于 2600 张显卡,显卡在挖矿领域已失去竞争力。
- Tensor 核心与 AI:
- 功能:同时接收三个矩阵,执行前两个矩阵相乘后加上第三个矩阵。
- 应用:神经网络及生成式 AI 需执行万亿至千万亿次矩阵运算,Tensor 核心可并发完成这些计算。
👤 同一博主
microSD 卡如何实现海量数据存储
GPU 是如何用光“打印”出来的
被遗忘的苹果产品:彻底改变计算机行业的 Apple II
计算机缓存、内存与存储是如何工作的?🖥️💿🛠️
计算机的惊人演变
驱动数字世界的工程:CPU 的工作原理
价值2亿美元的微芯片“打印机”:EUV光刻系统
晶体管如何构建CPU?
光线追踪在电子游戏和电影中的工作原理
🧭 类似博主
-
苹果摄像头AirPods不会在今年发布
-
我发现了史上最疯狂的创造论宣传
-
晶片小到「看不見」怎麼製造?一個微小缺陷就讓晶片報廢!蔡司如何替半導體找出真兇?
-
永不失联,全新免费开源VPN!不用注册/不用邮箱!支持全平台设备使用!
-
火箭降落的全过程,拍到了!
-
苹果确认新款 Apple TV 4K 将带来两项重大升级
-
【李永乐老师】岚图汽车360°隧道大回环是真的吗?全网最硬核解读终于来了!
-
英伟达CPO全面量产,“硅光时代”真的要来了?一次讲清硅光互联的产业逻辑
-
摇可乐会喷的真正原因,你可能错了十几年!#知識分享 #科學揭秘 #科學 #科普 #冷知識 #物理 #
-
Claude Cowork 新手教程
0 条评论
发表评论
请先 登录 后参与讨论。