随着推理模型持续突破能力边界、Coding Agent深度参与研发流程,AI正从回答问题的模型演变为能够自主规划、调用工具、执行任务的软件系统。这意味着团队需要思考的不再只是如何训练、部署模型或优化Prompt,而是如何让具备自主能力的AI稳定、可信、可控地运行。模型决定AI能做什么,系统决定AI能否真正创造价值。
2026年QCon全球软件开发大会·上海站将于10月22日至24日举办,聚焦Harness AI时代的工程实践,围绕AI Native架构、Agent Runtime、AI Infra、Data Systems、Agent安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等方向,邀请全球技术社区与产业一线实践者分享前沿洞察与实战经验。
香港科技大学助理教授袁彬航博士已确认出席“AI Infra:算力效率决定规模化落地”专题,发表题为《让 Agent 越用越强:AReaL 2.0 构建 Agent 在线强化学习闭环》的分享。他指出,随着Coding Agent、企业智能助手等应用进入真实生产环境,如何让Agent在持续使用中不断提升能力成为下一阶段的重要挑战;传统Agent系统产生的大量交互轨迹、工具调用记录和用户反馈通常仅用于日志分析,难以转化为模型能力提升的数据闭环。
本次分享将介绍AReaL 2.0如何构建面向Agent自演进的在线强化学习基础设施。方案通过Agent轨迹协议、数据代理层和演进控制平面,将真实业务交互转化为可训练、可回放、可治理的数据,并通过微服务化Agent-Compute架构,实现无需重构原有Agent即可接入Online RL。在Hermes Agent和软件工程Agent场景中,该方案支持大规模并发环境、异步训练和持续优化,使Agent从“一次性执行系统”逐步演进为“持续学习系统”。
袁彬航博士现任香港科技大学计算机科学与工程系助理教授,在莱斯大学获得博士和硕士学位,在复旦大学获得学士学位,加入港科大前曾在苏黎世联邦理工学院担任博士后研究员,主要研究方向包括大语言模型服务系统、面向机器学习的数据管理系统以及分布式和去中心化机器学习系统,曾获2019年VLDB最佳论文提名奖和2020年SIGMOD研究亮点奖。