过去几个月,Claude Fable 5.1、Gemini 3.8 Flash 与 GPT-6 Astra 等新一代基础模型接连发布,几乎都在追求Agent适配能力,让推理时间更长、工具调用更顺、决策链条更稳。Agent由此加速进入企业端。数据显示,2026至2027年,中国企业场景中的活跃智能体数量单年同比增长超200%,到2031年预计可达3.5亿个。
但数据中心正面临巨大挑战。现有基础设施基本为大模型单次推理调用的吞吐量而设计,并未考虑Agent高频、突发、有状态且工具调用穿插其中的工作负载。谷歌调研显示,近83%的企业高管认为基础设施需要为Agent时代重新调整;AMD表示CPU和GPU配比要重新调整;AWS与NVIDIA也宣布联手打造下一代AI基础设施。不过这些说法多围绕核心数、带宽等输入端理论参数。
英特尔在8月发布的白皮书中提出不同立场:数据中心优化的关键不在提升理论参数值,而在于实际应用场景下满足延迟承诺时能维持多少Agent任务量,即“去计算数据中心的实际工作量,而不是理论的性能上限”。
白皮书拆解了一轮Agent任务的时间构成:模型调用(预填充加解码)约占总任务时间40%,主要跑在GPU上;其余60%在主机端,主要跑在CPU上,其中工具执行占35%,数据服务占10%,状态搬运约8%,编排调度占7%。35%的工具执行是主机端最大单项开销,其背后是沙箱——一个节点上可能同时运行几百个沙箱,快照压缩、解压、内存分配等CPU密集操作需线性排队,并发会话下沙箱时间开销将成为主要延迟。
一项对739次匿名化Claude Code对话的测量显示,单个请求任务时主机端CPU耗时在端到端延迟中仅占0.4%至0.6%,但并发到32个会话时,该比例跳升至11%至15%。英特尔将于9月22日至23日在苏州举办2026年Intel Connection大会,展示最新DCG产品及面向企业AI应用落地场景的对应产品。
咨询
咨询