阿里云近日宣布开源其最新的全模态模型Qwen2.5-Omni,该模型能够同时处理文本、图像、音频和视频等多种输入,并支持实时流式输出。这一发布标志着阿里在多模态AI领域迈出了重要一步,为开发者提供了更强大的工具来构建交互式应用。
Qwen2.5-Omni采用统一的Transformer架构,通过创新的注意力机制实现跨模态对齐,在多项基准测试中表现优异,尤其在语音识别和视觉问答任务上超越了现有开源模型。阿里云表示,该模型已集成至其ModelScope平台,并提供了完整的推理和微调代码,方便社区进行二次开发。
业内分析认为,全模态模型的开放将加速AI在智能助手、视频理解等场景的落地,但同时也对计算资源提出了更高要求。阿里云此次开源策略旨在推动生态建设,巩固其在AI云服务市场的竞争力。