企业AI算力采购激增,但因资源碎片化、环境割裂与调度低效,实际可用算力远低于账面规模。一边是业务团队排队等算力,一边是大批算力卡在低效空转,这种尴尬现实在很多企业机房并不罕见。过去一年多,英伟达GPU以及昇腾、海光、寒武纪、壁仞等国产AI芯片成批进驻数据中心,但重金投入之后,业务一线与IT部门的摩擦却越来越大。
近期,权威调研机构IDC发布《中国AI算力管理平台技术能力评估,2026》,将资源管理、服务管理、运维、技术架构、业务场景支撑与交付服务纳入六大评估维度。其中,范式智能(前第四范式)综合评分位列第一,在资源管理、运维、技术架构及交付服务四项维度获得满分。
报告指出,企业账面算力与实际可用算力之间通常隔着三个断层。一是异构芯片的软件壁垒,不同品牌计算卡的底层驱动、编译环境、算子库与推理引擎各不相同,缺乏跨芯片统一抽象层,导致集群之间无法动态互援。二是整卡分配导致的隐形浪费,轻量级任务也需独占一张大算力卡,造成账面已满、实则大半空转的资源假溢出。三是智能体带来的潮汐冲击,Agent时代业务调用演化为长链路、高频反思、多模型联动的脉冲式洪峰,静态分配与人工预留难以应对。
要把散落的硬件真正变成可用服务,关键在于补齐三层能力。针对整卡粗放分配问题,核心难点在于强隔离,既要通过资源共享压榨闲置算力,又要防止任务抢占拖垮核心业务。今年7月晋升为CNCF孵化级项目的开源调度器HAMi值得关注,该项目主要由范式团队贡献,聚焦动态弹性切分、消除调度资源误判,并打通与批量调度引擎的协同。分布式训练则需在调度层引入成组调度机制,将整个任务的所有节点打包,严格执行要么全部满足、要么一个不跑的策略。
扫码查看视频号
咨询
咨询