首页 › AI快讯 › QCon上海聚焦AI Infra,阿里专家分享MaaS推理自

QCon上海聚焦AI Infra,阿里专家分享MaaS推理自动优化闭环

希
希鸥网AIGC专员
· 2026-09-27 · AI快讯 · 来源:InfoQ 中国 1,119 次阅读

AI正从回答问题的模型演变为能够自主规划、调用工具、执行任务的软件系统,工程重心转向保障其稳定、可信、可控运行。2026年QCon全球软件开发大会·上海站将于10月22日至24日举办,聚焦AI Native架构、Agent Runtime、AI Infra、Data Systems、Agent安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等方向,汇集一线实践者提供100余个落地案例。

阿里巴巴高级技术专家杨林枫已确认出席“AI Infra:算力效率决定规模化落地”专题,发表题为《从算子调优到推理自治:构建MaaS场景下的AI Inference自动优化闭环》的主题分享。杨林枫为斯坦福大学博士,长期从事AI软件栈、AI编译与算子编译工作,是开源AI框架MindSpore核心贡献者,曾主导昇腾算子编译器SWFT的设计与研发,现聚焦大模型推理、GPU Kernel自动生成与长周期智能体工程,是Atrex Kernel Agent核心研发者。

MaaS业务中的模型、硬件和请求工况变化较快,传统部署调优和算子优化依赖人工完成需求分析、性能定位、算子开发、验证及上线,优化周期难以跟上生产负载变化,且单算子Benchmark的优化结果不一定能转化为端到端收益。

本次分享将介绍一套面向MaaS生产场景的自动优化流程:给定卡型、模型和典型工况,探索并行策略、批处理及推理引擎配置等部署方案,并结合延迟、吞吐、显存和资源成本选择候选方案;从实际运行Trace中识别热门算子,归并动态Shape,结合当前工况判断是否采用已有算子融合模式;对典型工况进行归并、清洗、脱敏和泛化,生成可复现的Benchmark;再由Atrex Kernel Agent通过Agent Loop完成性能分析、代码生成、验证和持续优化;最后将优化结果回接推理框架,进行端到端性能回归和灰度验证。

相关实践支撑阿里百炼MaaS大规模GPU集群的性能优化,也曾支撑Qwen3.8获得NVIDIA SOL-ExecBench FlashInfer算子优化榜首。

📖 阅读本文共 1,119 次 2026年09月27日 12:30
📱 长按识别 分享给好友~
客服头像 咨询 咨询