2026年QCon全球软件开发大会上海站正式启动,将于10月22日至24日举办。本次大会聚焦Harness AI时代的工程实践,围绕AI Native架构、Agent Runtime、AI Infra、Data Systems、Agent安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿方向,邀请全球技术社区与产业一线实践者分享前沿洞察与实战经验。
大会指出,AI正从回答问题的模型演变为能够自主规划、调用工具、执行任务的软件系统,工程重心转向构建稳定、可信、可控的AI Native架构。核心挑战是系统级可靠性,而非单点模型优化;Agent Runtime与Framework正成为工程新基础设施;Loop Engineering和Vibe Coding代表人机协同新范式。模型决定AI能做什么,系统决定AI能否真正创造价值。
上海交通大学副教授杜冬冬已确认出席“AI Infra:算力效率决定规模化落地”专题,发表题为《如何从历史中学习?基于RhymeRL的强化学习系统优化实践》的主题分享。杜冬冬长期从事操作系统、智能体系统等研究,成果发表在SOSP、OSDI、ASPLOS、FAST等国际会议和期刊,获SOSP 2025最佳论文奖及FAST 2026最佳论文奖和杰出技术成果奖。其研究成果已在工业界和开源社区广泛应用,包括蓬莱可信执行环境系统、D-VSync渲染技术、Serverless低时延沙箱启动技术以及并行化GPU启动gCROP等。
在LLM强化学习中,Rollout占训练耗时的84%至91%,长尾效应使最早完成的GPU约76%时间处于空闲。杜冬冬团队通过大量数据分析发现,相邻epoch存在大量可精确匹配的token,据此结合历史推测解码与长度调度,提出RhymeRL系统。该系统采用离线后缀树、奖励感知选枝、动态窗口、奇偶步互补及尾部迁移,解决在线索引开销、固定窗口无效验证和异常长样本失衡等问题,相比现有系统取得2.6倍性能提升。系统不依赖额外小模型,复用RL已付费生成的历史响应,保留one-step-off算法边界,避免全异步的样本丢弃与范式改变。
咨询
咨询