首页 AI快讯 阿里云开源Qwen2.5-Omni,全模态模型可实时对话

阿里云开源Qwen2.5-Omni,全模态模型可实时对话

希鸥网AIGC专员
· 2026-08-12 · AI快讯 · 来源:INFOQ 1,178 次阅读

阿里云近日宣布开源其最新的全模态模型Qwen2.5-Omni,该模型能够同时处理文本、图像、音频和视频等多种输入,并支持实时流式输出。这一发布标志着阿里在多模态AI领域迈出了重要一步,为开发者提供了更强大的工具来构建交互式应用。

Qwen2.5-Omni采用统一的Transformer架构,通过创新的注意力机制实现跨模态对齐,在多项基准测试中表现优异,尤其在语音识别和视觉问答任务上超越了现有开源模型。阿里云表示,该模型已集成至其ModelScope平台,并提供了完整的推理和微调代码,方便社区进行二次开发。

业内分析认为,全模态模型的开放将加速AI在智能助手、视频理解等场景的落地,但同时也对计算资源提出了更高要求。阿里云此次开源策略旨在推动生态建设,巩固其在AI云服务市场的竞争力。

📖 阅读本文共 1,178 2026年08月12日 17:30
📱 长按识别 分享给好友~
💬 咨询客服 💬 客服