智谱创始人、首席科学家唐杰及GLM团队发布长文,披露GLM已不再只是辅助工程师写代码,而是开始直接参与自身推理基础设施的建设与优化。在GLM-5.3-Flash上线过程中,由GLM-5.3驱动的Infra Agent在超过10万张国产芯片组成的集群上完成模型适配、系统诊断和性能优化,不到两周将端到端吞吐提升至初始基线的3倍。
更重要的是,Agent已能根据测试、Trace、Benchmark等“稠密反馈”自主提出假设、修改代码并验证结果,使模型开始优化承载自身运行的系统。唐杰及GLM团队认为,这还不是完整意义上的递归自我改进(RSI),但已出现早期形态:AI正从“帮助人类研发模型”走向“参与构建自己的继任者”。
GLM团队在文中回顾,2025年10月启动安全能力增强研究时判断安全能力是代码能力的自然延伸,不到一年,安全伙伴使用GLM在真实代码库中发现数千个漏洞,模型开始改变网络安全格局,也带来过去不曾存在的危险,为此团队不得不设计受信访问计划。团队坦言,GLM-4.7之前内部用GLM写代码多少带着被迫成分,如今GLM-5.3已成为每个人每天离不开的Coding伙伴,“正一步步走向取代我们”。
GLM-5.3-Flash的上线是一套庞大系统工程。在超过10万卡国产芯片集群上,团队从零搭建了完整的生产级推理服务,全部线上推理运行其上。此前无人成功部署过如此大规模的国产卡集群,面对芯片内存容量和带宽相对受限、需支持新结构模型1M上下文窗口和多模态请求、生态不成熟、算子不完备等挑战,最终完成这项工作的不是一支团队,而是GLM-5.3驱动的Infra Agent。
GLM-5.3-Flash随后以匿名模型Ox-Alpha在OpenCode与OpenRouter上接受真实调用检验,上线一周成为双平台调用量最大的模型,6天token调用量超过62万亿。团队实施了以算力换带宽、以通信换显存等激进内存优化,技术栈融合针对线性注意力和LM Head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合精度缓存量化以及Layer Split等关键技术。