在AICC 2026人工智能计算大会上,IDC发布《2026年中国人工智能计算力发展评估报告》。报告指出,Agent大爆发之后,AI对算力的需求正在发生质变:过去算力调用更像“脉冲式”,用户问一个问题、系统返回一个答案;而在Agent接管任务后,一个人类意图可能触发几十次、几百次连续推理,多个Agent组成协作网络后,系统连续运转时长可增加到几个小时甚至好几天。
IDC数据显示,从今年到2030年,全球Token消耗量的复合增长率将达到4822.6%。但算力供给增长速度滞后于需求变化,全球AI算力需求满足率从2024年的79%一路下滑,2027年预计跌至71%,到2030年也只能恢复到77%左右。到2030年,算力缺口的绝对值将达到3809亿美元,扩大到2024年的近十倍。
单纯堆卡已难以解决算力瓶颈。Agent时代推理负载种类繁多:Prefill阶段是高并行、高计算密度任务,Decode阶段逐Token串行处理、更吃内存带宽,Attention需频繁访问不断增长的KV Cache,MoE包含稀疏计算和大规模路由调度,多模态模型还有独立的Encoder模块。这些负载的计算特征各异,还会随上下文长度、输出长度和并发规模动态变化,堆料反而会造成资源配比失衡。
浪潮信息首席AI战略官刘军将算力缺口概括为Capability与Capacity两个方向:能力型智算支撑前沿模型挑战过去碰不了的问题,如发现新药物分子、求解NS方程与孪生素数猜想、自主设计AI芯片;容量型智算则让智能供给更充足也更便宜。针对这两层问题,浪潮信息在AICC2026上发布了两款产品,其中包括超节点AI服务器“元脑SD200”。
扫码查看视频号
咨询
咨询