9月22日,阿里巴巴在云栖大会上公布大模型一系列进展。阿里方面表示,大模型递归自我改进(RSI)已初步进入模型训练、推理及芯模协同等环节,基于新一代架构的Qwen4正在训练中,未来Qwen4.5、Qwen5等版本将扩展至5-10T参数。Qwen LLM项目负责人刘大一恒表示,Scaling是迈向ASI的关键路径。
在模型自我训练方面,Qwen3.8-Max通过自主搭建训练流程、构造训练数据并自主设计实验、定位缺陷,在人类完全“零参与”的情况下持续迭代超1个月,完成33轮有效迭代。基于RSI、后训练等技术联合优化,其新版本在Artificial Analysis上的得分从40涨至45分,与Claude、GPT最强模型同处第一阵营,领先于GLM5.3、Kimi-K3等国产模型。在推理优化上,Qwen3.8-Max在平头哥新款GPU上自主适配优化了下代架构Qwen3.8-Flash的推理框架,单实例推理吞吐量提升96%;在芯片模型协同设计上,其仅基于一份真实总线模块规范,自主运行超60小时、调用EDA工具超万次,完成减少42%面积的物理实现优化。
架构与模态方面,Qwen3.8-Flash提前开源下一代千问大模型架构,通过注意力机制和模型内信息传递机制等创新,在实现前沿性能的同时训练成本骤降近90%;全模态模型Qwen3.8-Omni正式亮相,将音视频等不同模态纳入统一理解框架。阿里巴巴ATH技术副总裁、淘天集团首席科学家郑波在大会现场提到,三年内会出现一个原生全模态统一模型,体验将不再受限于模态的边界。
开源生态方面,Qwen3.8-27B在Hugging Face上超越DeepSeek-R1、Meta-Llama3.1等热门模型,成为该平台历史上最受欢迎的开源大模型。公开数据显示,阿里已开源460余个Qwen大模型,下载量突破30亿次,衍生模型数超30万个。
视觉生成领域,图像生成模型Qwen-Image-3.1亮相,面向电商、创意、设计等真实商用场景优化升级,将原本数小时的视觉设计压缩至秒级交付,并支持图像精准编辑;音乐生成模型Happy Shrimp 1.1发布,在音乐表现、人声质量、多语种演唱及指令理解四个维度提升,支持百余种曲风与十余种主流语言;世界模型HappyOyster 2.0 Preview亮相,提升智能实时交互、记忆能力、实时响应与物理规律遵循等核心能力。全新的下一代视频生成模型将于11月发布,朝更长、更可控、更完整、更智能的方向演进。
扫码查看视频号
咨询
咨询