推理创业公司Inferact公布的一组benchmark显示,16块谷歌TPU v7 Ironwood运行Kimi K3时每秒可跑出709个Token,而同样16块英伟达GB200为每秒452个,TPU速度高出57%。测试中两边均使用vLLM推理引擎,唯一变量是芯片与底层kernel实现。Inferact创始团队来自vLLM原班人马,今年获得a16z领投的1.5亿美元种子轮融资,估值8亿美元。
这一成绩有DeepSeek提出的DSpark推测解码框架的贡献。该框架让一个小模型先快速猜出一串候选token,再由大模型批量验证,猜对的直接跳过,猜错的回退重来。Inferact在TPU上跑通该流程后,acceptance length达到6,单步decode耗时约8.5毫秒。关闭推测解码后差距依然明显:batch size为1时TPU每秒249个token,GB200为127个;batch size放大到8,TPU达865个,GB200为636个。在Qwen上差距更大,4块TPU v7跑Qwen 3.8 27B达到每秒1515个token,同配置GB200为695个。精度方面,Kimi K3在TPU上的GPQA-Diamond得分为94.4%,GSM8K为97.2%,与GPU结果一致。
值得注意的是,TPU v7的HBM带宽为7380 GB/s,反而低于GB200的8000 GB/s,速度差距并非来自硬件规格,而是来自芯片上运行的软件。Inferact采用名为megakernel的方案,把模型推理时原本需要调度的几百个独立小程序合并成一个大程序,消除程序切换时的带宽浪费。
Kimi K3共有92层MoE计算,Inferact将其计算逻辑从头到尾塞进一个Pallas程序,一次调用即完成整个模型的前向传播。边界消失后,跨层权重预取得以实现:第N层还在计算MoE时,第N+1层的attention权重已开始从HBM搬往片上缓存,计算与数据搬运同时进行,内存带宽利用率被推至硬件理论峰值附近。
扫码查看视频号
咨询
咨询