首页 › AI快讯 › 商汤大装置分享异构混推实践:日均Token服务量8月达4.5

商汤大装置分享异构混推实践:日均Token服务量8月达4.5万亿

希
希鸥网AIGC专员
· 2026-10-04 · AI快讯 · 来源:量子位 1,404 次阅读

在近日举办的“2026全球AI芯片峰会·Token工厂异构混训混推技术研讨会”上,商汤大装置资深技术专家罗伟以《Token工厂:以异构算力构建新一代AI基础设施》为题发表演讲,剖析规模化推理面临的系统挑战,并分享异构推理架构与关键技术演进实践。

罗伟指出,Agent时代的负载特征与传统单轮对话明显不同:长上下文带来输入计算和KV Cache占用持续增长,连续多轮对话使前缀复用和热点不断变化,突发与长尾需求令流量和长度分布持续波动。商汤大装置的底层逻辑已转向“以Token、状态与时延预算为中心”,围绕Token生产效率、交付质量与单位成本组织资源。目前其日均Token服务量已从2月的0.46万亿增长至8月的4.5万亿。

在实践层面,商汤大装置以“横向编排”与“纵向优化”两条主线提升系统级Token产能。横向针对不同品牌、规格算力构建统一资源画像,覆盖计算吞吐、KV Cache容量、有效带宽与模型兼容性,并对推理请求进行全生命周期管控;平台不会将某类芯片永久固定为P节点或D节点,而是根据模型、批量与上下文长度的瓶颈变化动态调整角色分工。纵向则深化“模型×引擎×芯片”三层优化,在模型层调优权重量化与显存预算,在引擎层优化Attention、GEMM等核心算子,在芯片层适配编译、访存调度与内存管理。

罗伟还分享了两大技术演进方向:一是从固定P/D配比走向动态资源池化,分别构建Prefill Pool和Decode Pool,依据实时负载、KV Cache状态及节点健康度动态路由,并通过角色切换灵活转换P/D节点;二是面向多模态与MoE模型,从P/D两阶段走向模块级资源池,将Encoder、Attention、FFN、视觉编码等拆分为独立资源池,按负载特点弹性扩缩容。

📖 阅读本文共 1,404 次 2026年10月04日 12:30
📱 长按识别 分享给好友~
视频号二维码

扫码查看视频号

客服头像 咨询 咨询