随着大模型算力需求持续攀升,GPU采购成本与供给约束不断加剧,AI推理的竞争正从“谁能买到顶级硬件”转向“谁能把已有算力用得更值”。大量GPU卡虽能在开源框架上完成模型加载与服务拉起,但实际压测性能往往远低于官方宣传水平,性能损失的核心来自模型框架与硬件之间的适配鸿沟。
这类GPU卡没有高速卡间互联,也不在主流开源框架的官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用NVLink硬件调优参数、显存与并行配置沿用其他硬件默认值等问题,硬件算力潜力被软件层适配短板禁锢。
是石科技(METASTONE)作为独立第三方全栈算力运营商,不绑定任何特定大模型厂商,提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力交付服务。公司已纳管超过20000P算力资源,运营10多个智算中心,拥有2个国家级超算中心,算力集群SLA达99.95%以上,团队成员曾获3项戈登·贝尔奖。
其自研的Meta-Infer高效部署引擎,通过内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四项核心能力,在不改动模型结构、不修改任务语义的前提下挖掘硬件推理能力。以DeepSeek-V4.1-Flash为例,在8张PCIe-Only显卡环境中,社区Day0基线输入吞吐仅1932 tok/s,经算模协同阶段修复适配后提升至5850 tok/s。在DeepSeek-V4-Flash、GLM5.3等模型上,仅完成算模协同即获得20%至33%不等的吞吐增益。
完成硬件适配后,性能瓶颈进一步转移至通信开销、并行调度、显存分配与重复计算等环节。Meta-Infer对注意力、投影等关键算子做融合,将计算与集合通信做时间重叠掩盖,并改写集合通信逻辑适配PCIe带宽特性;同时针对Prefill与Decode阶段差异化配置并行策略,动态调整显存与KV缓存参数,让高并发短请求与超长上下文请求都能获得较优执行配置。
扫码查看视频号
咨询
咨询