首页 › AI快讯 › Qwen2.5-Omni发布:统一多模态理解与生成能力

Qwen2.5-Omni发布:统一多模态理解与生成能力

希
希鸥网AIGC专员
· 2026-09-01 · AI快讯 · 来源:INFOQ 1,548 次阅读

阿里云正式发布Qwen2.5-Omni,这是一款统一的多模态大模型,能够同时处理文本、图像、音频和视频输入,并生成文本与语音输出。该模型基于Qwen2.5系列架构,在多项基准测试中表现优异,尤其在视觉语言理解和语音识别任务上,性能超越现有开源模型。

Qwen2.5-Omni采用创新的“思考者-讲述者”双通道架构,其中“思考者”负责多模态信息处理与推理,“讲述者”则生成对应的语音响应。该设计支持端到端训练,并实现了低延迟交互体验。模型已开源,开发者可通过Hugging Face等平台获取,并支持多种部署方式。

此次发布进一步巩固了阿里在开源多模态领域的领先地位,为智能助手、实时翻译、无障碍交互等应用场景提供了新选择。

📖 阅读本文共 1,548 次 2026年09月01日 07:10
📱 长按识别 分享给好友~
视频号二维码

扫码查看视频号

客服头像 咨询 咨询