在9月22日举行的云栖大会上,阿里云集中发布全模态模型矩阵。千问基座模型方面,Qwen3.8-Max开始自己训练自己,Qwen3.8-Flash提前放出下一代架构,Qwen3.8-Omni为大模型开辟全新思考分区,Qwen4已投入训练,Qwen4.5、Qwen5也在规划中,参数规模瞄准5万亿至10万亿。图像生成模型Qwen-Image-3.1、音乐生成模型Happy Shrimp 1.1、世界模型HappyOyster 2.0 Preview、语音模型家族Qwen-Audio-3.1及同声传译模型Qwen3.8-LiveTranslate集体亮相,下一代视频生成模型预告将于11月发布。
导演陆川和团队借助阿里视频生成模型,还原了一场发生在400年前的明代灾难现场。按照传统影视工业做法,此类场景复原往往需要数月时间和千万级投入,仅一场爆炸戏就要耗费19天。陆川团队将史料文字翻译为现代视觉概念,前后进行约四轮提示词优化,并参考真实爆炸影像校准,最终模型对烟尘、碎片等复杂画面的还原准确度达到团队预期的95%以上。
从史料搜集、画面制作到主题讨论,AI开始进入完整创作链路,单在视频生成环节,阿里模型的贡献度就超过一半。阿里巴巴ATH事业群副总裁、淘天集团首席科学家郑波表示,文本、图像、视频、声音、空间的能力正在加速协同,AI正从生成一张图、一段视频、一首音乐,走向理解人的意图、创造完整沉浸式视听体验。阿里方面判断,如果语言模型是机器的大脑,多模态模型正在成为机器感知世界、创造内容并与物理世界互动的中枢。
从模型布局看,Qwen负责语言、知识和推理,Image、Wan、Happy Horse、Audio、Happy Shrimp将能力延伸至视觉、影像、声音和音乐,HappyOyster向三维空间和交互环境拓展,Omni处理不同模态之间的统一理解,Agent则把这些能力接入实际任务。阿里方面认为,三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。