来客网

让Kimi K3自己写「超级算子」:快了3倍

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

大模型提速,原来还有这条路!

上一周,vLLM原班人马创办的Inferact,开源了一套TPU Megakernels(巨型算子)。

他们把Kimi K3的92个MoE层一层不落地写进同一个程序,扔到16颗谷歌TPU v7上跑:

开着投机解码,单用户输出速度达到709 tokens/s;同样16块英伟达GB200,用vLLM跑,是452 tokens/s。

关掉投机解码,在1到8的并发下,它也都是GB200的1.4到2倍。

最扎心的是,按纸面参数,TPU v7的显存带宽(7380GB/s)还比GB200(8000GB/s)低一截。

硬件没占到便宜,赢在了写法上。

还有个彩蛋,这套巨型算子从零编译只要不到90秒。以前在TPU上编译一个同量级的大模型,动辄半小时起步。

0

评论 (0)