清华大学计算机系教授、智谱创始人唐杰分享了一个内部观察到的RSI早期案例:GLM-5.3驱动的Infra Agent在超过10万张国产芯片组成的集群上,从零参与搭建并优化了一套生产级推理系统,不到两周端到端吞吐提升至初始基线的3.2倍。

这并非简单的AI写代码。从算子精度问题到Python/C++跨层并发瓶颈,再到Kernel性能优化,Agent已能自己读取系统反馈、提出假设、修改代码、跑实验,再根据结果继续迭代。它定位出KV Transfer场景中Python GIL导致的并发阻塞,把Prefill+KV Transfer相比单独Prefill超过20%的性能损失压到1%以内;还在KDA Decode算子上通过重新组织计算拿到1.71倍性能提升。一个闭环由此出现:GLM优化运行GLM的系统,被优化后的系统又继续承载新的GLM。

唐杰同时强调,这距离真正意义上AI完全自主设计并训练自己的继任者还很远,目标设定、边界划定和风险判断目前仍由人类工程师负责,智谱也明确表示尚未实现RSI。但这一案例让RSI第一次有了工程化、甚至已跑进生产环境的雏形。

GLM-5.3-Flash的上线同样经历了这一过程。在超过10万卡国产芯片集群上,团队从零搭建完整生产级推理服务,面对芯片内存容量和带宽受限、需支持1M上下文窗口和多模态请求、生态不成熟、算子不完备等挑战,最终由GLM-5.3驱动的Infra Agent完成。GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode与OpenRouter接受真实调用检验,上线一周成为双平台调用量最大的模型,6天token调用量超过62万亿。