首页 › AI快讯 › 是石科技Meta-Infer引擎:PCIe显卡推理吞吐提升近

是石科技Meta-Infer引擎:PCIe显卡推理吞吐提升近7倍

希
希鸥网AIGC专员
· 2026-10-06 · AI快讯 · 来源:量子位 1,043 次阅读

随着大模型算力需求持续攀升,GPU采购成本与供给约束不断加剧,AI推理的竞争正从“谁能买到顶级硬件”转向“谁能把已有算力用得更值”。大量GPU卡虽能在开源框架上完成模型加载与服务拉起,但实际压测性能往往远低于官方宣传水平,性能损失的核心来自模型框架与硬件之间的适配鸿沟。

这类GPU卡没有高速卡间互联,也不在主流开源框架的官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用NVLink硬件调优参数、显存与并行配置沿用其他硬件默认值等问题,硬件算力潜力被软件层适配短板禁锢。

是石科技(METASTONE)作为独立第三方全栈算力运营商,不绑定任何特定大模型厂商,提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力交付服务。公司已纳管超过20000P算力资源,运营10多个智算中心,拥有2个国家级超算中心,算力集群SLA达99.95%以上,团队成员曾获3项戈登·贝尔奖。

其自研的Meta-Infer高效部署引擎,通过内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四项核心能力,在不改动模型结构、不修改任务语义的前提下挖掘硬件推理能力。以DeepSeek-V4.1-Flash为例,在8张PCIe-Only显卡环境中,社区Day0基线输入吞吐仅1932 tok/s,经算模协同阶段修复适配后提升至5850 tok/s。在DeepSeek-V4-Flash、GLM5.3等模型上,仅完成算模协同即获得20%至33%不等的吞吐增益。

完成硬件适配后,性能瓶颈进一步转移至通信开销、并行调度、显存分配与重复计算等环节。Meta-Infer对注意力、投影等关键算子做融合,将计算与集合通信做时间重叠掩盖,并改写集合通信逻辑适配PCIe带宽特性;同时针对Prefill与Decode阶段差异化配置并行策略,动态调整显存与KV缓存参数,让高并发短请求与超长上下文请求都能获得较优执行配置。

📖 阅读本文共 1,043 次 2026年10月06日 08:30
📱 长按识别 分享给好友~
视频号二维码

扫码查看视频号

客服头像 咨询 咨询