AI生产化正迫使模型、编排与基础设施三者深度耦合,传统云原生分层架构面临重构。在KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026上,CNCF、OpenInfra与PyTorch三个过去分处不同技术层的开源社区首次同台,共同应对AI系统接口、协同与边界问题。行业共识是:现有基础设施能力尚未满足真实AI生产负载需求。
OpenInfra基金会总经理Thierry Carrez表示:“无基础设施,不AI。”模型、推理服务、Agent最终都要落到计算、加速器、网络和存储上运行,但AI带来的基础设施要求与传统云工作负载明显不同。一方面,GPU和各种加速器越来越多样,企业需要把异构资源组织成统一资源池;另一方面,GPU价格高昂,利用率需尽可能压榨至接近满负载。Agent的出现又把隔离和控制问题推到了更前面。
CNCF执行总监Jonathan Bryce提到,云计算过去十几年的核心方向是尽量把环境标准化,再通过API动态访问资源,但AI正在重新把异构性带回基础设施。为充分释放AI系统性能,企业会使用定制硬件、定制Kernel,从芯片到Agent各层联系更紧密,没有一个单独开源项目能覆盖整条技术链路。这种变化已深入到单个AI请求内部:KV Cache可放在内存或卸载到高速存储,Prefill和Decode阶段的资源特征也不同,基础设施需要理解请求内部不同阶段的资源需求,再决定任务落在哪种计算、存储和网络资源上。
第二个变化来自Agent。传统互联网服务的大量请求由人触发,行为模式相对可预测;Agent则可以自己拆任务、调用工具、并行发起请求,工作负载形态完全不同。Jonathan认为,Agent正在产生并行度更高、资源需求呈指数级增长的工作负载,这将直接影响过去围绕人类访问模式设计的路由、缓存、容量规划乃至安全策略。
咨询
咨询