近日,深圳存算一体AI芯片创企九天睿芯发布了一套面向超大MoE模型的推理部署方案。该方案在“单卡+4 SSD”的配置下,让DeepSeek-V4在decode阶段的速度跑到了约20 TPS,具备了真正可用的吞吐量。

据了解,九天睿芯已于去年开始,作为国内首家与关键存储合作伙伴研发基于HBF和sram存算一体堆叠的万亿参数AI推理芯片。