阿里云正式发布Qwen2.5-Omni,这是一款统一的多模态大模型,能够同时处理文本、图像、音频和视频输入,并生成文本与语音输出。该模型基于Qwen2.5系列架构,在多项基准测试中表现优异,尤其在视觉语言理解和语音识别任务上,性能超越现有开源模型。
Qwen2.5-Omni采用创新的“思考者-讲述者”双通道架构,其中“思考者”负责多模态信息处理与推理,“讲述者”则生成对应的语音响应。该设计支持端到端训练,并实现了低延迟交互体验。模型已开源,开发者可通过Hugging Face等平台获取,并支持多种部署方式。
此次发布进一步巩固了阿里在开源多模态领域的领先地位,为智能助手、实时翻译、无障碍交互等应用场景提供了新选择。