博主头像

“榨”出硅的极限:怎么让GPU不“闲着”?|与SGLang、RadixArk深聊AI Infra技术

外来客 • 2026-08-14 07:56:33

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🚀 AI Infra:榨取硅基算力的极限与千亿市场机遇

💡 核心观点

随着AI模型竞争从训练转向推理部署,提高GPU利用率成为行业关键痛点与新增长点。硬件成本高昂且优化空间见顶,使得软件层(系统软件与服务编排)的优化成为释放算力潜力的核心手段。通过消除重复计算、减少等待时间、提升算力饱和度及资源协同,AI Infra正演变为连接模型与芯片的关键基础设施,甚至被视为“AI时代的操作系统”。

📊 关键事实与论据

1. GPU利用率现状与市场价值

  • 闲置严重:CMU对756款GPU(A100至B200)的监测显示,近20%的执行时间和约11%的能耗浪费在等待上;推理场景中,Asher Code负载高达65%、OpenEd Chat类请求达52%的能耗消耗在执行时空转。
  • 经济账:一台NVIDIA GB200 NVL72机柜成本约400万美元。若软件调度不佳导致利用率仅50%,相当于白白烧掉200万美元;若提升至90%以上,效果等同于凭空多出一台机柜。
  • 资本涌入:AI Infra赛道估值飙升。Bastion年收入增长20倍,估值从21亿涨至130亿美元;Fireworks 7个月内估值翻4倍达175亿美元。推理引擎VLLM和SGLang种子轮融资均超1亿美元

2. AI Infra四层架构与优化重点

  • 四层结构:能源基础设施(电)、计算硬件(卡/内存/CPU)、系统软件(CUDA/编译器/算子库)、服务编排(调度/推理引擎)。
  • 优化重心转移:底层硬问题(电力/散热)周期长、空间小;上层软问题(软件/调度)是工程与算法问题,优化后可带来数倍性能提升。Anthropic员工中占比最大的是AI Infra工程师,OpenAI等巨头也将此作为竞争壁垒。

3. SGLang/Radix Arc的核心技术策略

针对“哪些计算不用重做、哪些等待可消除、算力如何吃满、资源如何协同”四大问题,SGLang及其孵化项目Radix Arc提出以下方案:

  • KV Cache复用(Radix Tree):利用基础树数据结构组织请求的KV Cache,实现跨请求、跨机器的共享。配合Cache-Aware Scheduling将相似前缀请求集中处理,以及Eviction机制淘汰低价值缓存,显著降低显存压力与重复计算成本(Anthropic曾借此降低成本90%)。
  • 消除等待(Continuous Batching & PD分离):采用连续批处理替代传统排队或固定批次,使GPU保持满载,吞吐量提升2-4倍。实施Prefill(预填充)与Decode(解码)分离,将两阶段任务拆分至不同GPU集群互不干扰,DeepSeek及英伟达Dynamo架构均采用此思路。
  • 算力饱和(低精度 & 投机采样):通过独立设置模型权重、激活值、KV Cache的精度以利用低精度算力;引入投机采样(Speculative Sampling),用小模型生成草稿、大模型一次性验证,最佳情况下生成速度提升2-3倍。
  • 资源协同(Miles框架):针对强化学习(RL)中推理与训练交替进行的特性,推出开源训练框架Miles。将训练与推理置于同一系统,减少阶段切换等待,支持MOE架构及推训一致性优化,已被多家前沿实验室采用。

🏁 结论

AI Infra正在从少数巨头的独家资源转变为公共基础设施。SGLang等开源引擎通过Day0支持新硬件与新模型,降低了部署门槛,使初创公司也能获得顶级推理性能。Radix Arc的融资阵容(英伟达、AMD、Intel CEO陈立武、OpenAI联合创始人John Schulman等)表明,芯片厂商与投资机构将其视为连接算力与应用生态的战略入口。随着Infra红利的释放,更多创新团队将不再受限于工程门槛,从而加速AGI的到来。

0 条评论

发表评论

请先 登录 后参与讨论。