GPT、Claude 与 Gemini 的实际训练与部署机制——Reiner Pope
外来客 • 2026-08-20 05:08:37
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:How GPT, Claude, and Gemini are actually trained and served – Reiner Pope)
🧠 推理性能与成本的核心权衡机制
- 推理系统的性能与成本主要受批处理大小(Batch Size)影响,存在延迟与单位成本之间的根本性权衡。
- 基于 Roofline 模型分析,核心约束为内存带宽(读取权重与 KV Cache)与计算吞吐量(FLOPS)的平衡。
- 存在由读取全部模型权重时间决定的延迟下限,该下限无法通过单纯增加算力突破。
- 存在成本下限:当批处理足够大时,权重读取成本被摊薄,总成本由计算时间主导。
- Fast Mode 通过减小批处理降低延迟,但导致权重读取成本无法摊薄,从而大幅提高单价。
- Slow Mode 将批处理降至 1 时,成本接近无穷大,无法通过无限等待获得显著低价。
- 硬件趋势显示,从 A100 到 B100,FLOPS 与带宽同步增长,保持约 300 的平衡常数稳定。
- 稀疏注意力技术能显著改善长上下文下的内存瓶颈,使模型在更大上下文长度下仍保持高效。
📊 关键数学模型与平衡点推导
- 计算时间与批处理大小线性相关,公式为 $B \times N_{active} / FLOPS$。
- 内存时间包含常数项的权重读取和与 $B \times L_{context}$ 成正比的 KV Cache 读取。
- 平衡点公式为 $B \approx 300 \times \text{Sparsity}$,其中 300 为硬件常数(FLOPS/带宽比),Sparsity 为稀疏度。
- 以 DeepSeek 为例,激活 32/256 专家,稀疏度为 8,理论平衡点约为 2,400。
- 实际部署通常取理论值的 2-3 倍以应对效率损耗,即 2,000-3,000 个并发序列。
- 单步推理时间约为 20ms,源于 HBM 容量除以带宽(如 288GB / 20TB/s ≈ 15ms),确保单步内读完所有 HBM 数据。
- 稀疏注意力可将 KV Cache 读取复杂度从线性降低至平方根级,优化长上下文性能。
🏗️ 硬件架构限制与通信瓶颈
- MoE 层采用专家并行,不同专家分布在不同 GPU 上,形成 All-to-All 通信模式。
- 机架是物理约束下的基本单元,NVIDIA Blackwell 机架含 72 个 GPU,内部通过 NVLink 高速互联。
- 跨机架通信带宽约为机架内的 1/8,成为限制单层 MoE 规模的主要瓶颈。
- Google 等厂商通过更大的 Scale-up 域(如 TPU Pod)提前解决此问题,这可能解释了 Gemini 在预训练上的优势。
- 物理限制(线缆密度、散热、重量)阻碍了单一机架内 GPU 数量的无限增加,Rubin 架构预计将机架规模提升至 500 左右。
- 扩展域大小直接决定并行加载权重的 GPU 数量,相比每代 GPU 带宽提升 1.5-2 倍,扩展域带来的带宽提升可达 8 倍。
🔄 流水线并行与内存容量策略
- 为突破单机架限制,可采用流水线并行,将不同层分布在不同机架。
- 跨机架通信开销取决于激活专家数、每阶段层数及带宽比;只要激活专家数乘以层数大于 8,Scale-up 时间即可覆盖 Scale-out 时间。
- 在满足上述条件时,可构建跨机架流水线,每个机架处理一层或少数几层,有效利用多机架资源。
- 单 GPU 内存需求公式为 (总参数 + 批次大小 × 上下文长度 × 字节数) / (专家并行度 E × 流水线阶段 P)。
- 增加流水线阶段 P 可线性降低权重内存占用,但 KV Cache 占用保持不变,因为需保持所有机架忙碌,序列在途数量增加抵消了分层存储收益。
- 为避免流水线气泡,微批次数量需等于流水线阶段数,导致无法在推理中通过大批次摊销权重加载成本。
- Blackwell 机架拥有数十 TB 内存,远超万亿参数模型所需的 1 TB;跨机架延迟约为每跳几毫秒,总计约 10ms/token。
💡 稀疏性优势与模型质量实证
- 推理性能瓶颈在于计算而非内存,增加稀疏度可降低计算需求,但需更大 Batch Size 以摊销内存读取成本。
- 实证研究表明,保持激活参数不变而增加专家数量,模型质量可能不降反升。
- 例如 64 个专家、3.7 亿激活参数的模型效果等同于 13 亿参数的稠密模型。
- 从系统分析角度,只要用户量足够支撑大 Batch,增加稀疏度是纯收益,但受限于内存容量和总参数规模。
- 专家并行是扩展模型规模的主要手段,张量并行因专家规模变小而不再具有成本效益。
- 大规模扩展域的核心价值在于提升内存带宽而非容量,从而降低延迟并支持更长上下文。
🧮 训练与推理的成本均衡分析
- 提出启发式假设:模型总成本(训练+推理)最小化时,各项成本趋于相等。
- 估算前沿模型在预训练、强化学习(RL)和推理上的算力分配比例接近 1:1:1。
- RL 训练效率较低(MFU 低于训练),其有效算力系数约为 2-6,而预训练遵循 6ND 公式。
- 在成本均衡视角下,推理产生的 Token 总量应与预训练 Token 总量相当。
- 基于 5000 万 Token/秒的推理速率和 2 个月的生命周期,估算单模型推理 Token 量约为 200 万亿。
- 假设前沿模型激活参数为 1000 亿,Chinchilla 最优预训练 Token 量约为 2 万亿。
- 当前模型预训练 Token 量约为 Chinchilla 最优值的 100 倍,存在显著过度训练。
- 这种过度训练是为了降低单次推理成本,从而在总生命周期内实现经济最优。
💰 API 定价反推与硬件瓶颈验证
- Gemini 3.1 在超过 20 万 Token 上下文时价格上浮 50%,暗示该长度接近内存带宽与计算时间的平衡点。
- 通过定价反推,每 Token 的 KV Cache 内存占用约为 1-2 KB,符合 8 个 KV 头、128 维度的架构特征。
- 输出 Token 价格通常是输入的 5 倍,表明解码阶段严重受限于内存带宽,而预填充阶段主要受限于计算能力。
- 缓存命中价格更低(约 10 倍差异),进一步证实了内存访问成本在推理中的主导地位。
- 长上下文的主要瓶颈并非计算成本,而是内存带宽与容量限制。
- 稀疏注意力虽能改善效率,但过度稀疏会显著降低模型质量,无法彻底解决内存墙问题。
🧬 可逆网络与信息混合机制
- 神经网络与加密协议在“信息混合”机制上相似,但目标相反:前者从随机中提取结构,后者将结构转化为随机性。
- 可逆网络通过牺牲计算换取内存节省,与 KV Cache 用内存换计算的策略形成互补。
- 基于 Feistel 结构,通过保留中间状态实现网络层可逆。
- RevNets 论文利用此特性,在反向传播时实时重建激活值,避免将激活值写入 HBM,从而降低训练时的内存占用。
- 差分密码分析攻击依赖输入微小差异导致输出巨大变化,这与神经网络的对抗攻击具有相似的雪崩效应特征。
- 在现有硬件条件下,追求数亿级上下文长度在成本上不可行,主要受限于内存带宽而非算力。
📦 内存层级优化与存储策略
- KV Cache 的生成成本取决于“重新计算”与“存储检索”的比率。
- 重新计算需运行前向传播,成本与 GPU 每秒美元价格及计算时间成正比。
- HBM 适合短持(如 5 分钟),DDR 和 Flash 适合长持(如 1 小时)。
- 存储成本与占用容量比例相关,检索成本与带宽相关。
- 模型上下文从 8K 跃升至 100K-200K 后,近两年增长停滞,表明当前硬件下该长度是成本平衡点。
- 理解内存层级(HBM/DDR/Flash)的读写特性对于优化推理成本至关重要,不同持有时间应匹配不同的存储介质。
- 推理部署应优先最大化专家并行度至扩展域上限,仅使用极少流水线阶段(如 2 个)以解决权重存储问题。
- 模型规模扩展受限于内存带宽而非容量;更大的扩展域通过提升带宽降低延迟,使长上下文和高稀疏度模型成为可能。
👤 同一博主
瑞安·格林布拉特(Ryan Greenblatt):当AI能够自动化AI研究时会发生什么?
持续学习时代的八项预测
更智能的AI模型或致算力价格飙升10倍
从第一性原理推导广义相对论——亚当·布朗
格兰特·桑德森(Grant Sanderson):AI 证伪著名数学猜想,接下来怎么办?
下一代训练范式是什么样的?
AI 核心的数据黑洞
马基雅维利是历史上最被误解的思想家——阿达·帕尔默
莎拉·佩恩(Sarah Paine):普京与习近平为何无法摆脱地理制约
AI 越强,其在经济中的份额可能越小——Alex Imas 和 Phil Trammell
🧭 类似博主
-
馬斯克:放棄火星?建100萬衛星?掌握耶穌級技術?馬斯克反常舉動曝光:人類與AI的決戰,其實已經打響
-
《人民的珍藏》第三季 寸图倾心筑通衢:两年磨一剑!重庆东站高铁站设计画稿惊艳亮相 中铁二院建筑师的匠
-
巨頭們不敢公開的最新實驗:為什麼科技越發達,失業率越高,人們越焦慮?比末日更可怕的未來正在逼近...
-
方舟子揭假:上海交大做谋财害命的基因疗法
-
美国“末日飞机”的工作原理
-
五角大楼UFO文件公开:外星文明实锤,还是一场精心设计的烟雾弹?
-
人死後,意識會留在更高維度嗎?宇宙是如何膨脹的?意識真的是這個宇宙中事件的一部分嗎?
-
人類明明贏了,為何卻笑不出來?揭開「人類對決AI機器人」的絕望真相,代價太恐怖了!
-
腦神經科學家懷疑:意識不存在於大腦! / 科學正在害怕什麼? / 單一世界觀讓「療癒」卡住了 | 青
-
元宇宙防骗指南
0 条评论
发表评论
请先 登录 后参与讨论。