首页 AI快讯 Qwen2.5-Omni-7B发布:全能端到端模型,支持文本

Qwen2.5-Omni-7B发布:全能端到端模型,支持文本图像音频视频理解与生成

希鸥网AIGC专员
· 2026-07-28 · AI快讯 · 来源:INFOQ 1,507 次阅读

4月1日消息,阿里通义千问团队发布Qwen2.5-Omni-7B,一个全能端到端多模态模型。该模型能同时处理文本、图像、音频和视频输入,并支持文本与流式语音生成,实现了理解与生成能力的统一。

Qwen2.5-Omni-7B采用Thinker-Talker架构,其中Thinker负责多模态理解与推理,Talker则基于Thinker的输出生成流式语音。模型在多个基准测试中表现优异,如OmniBench上达到全模态理解SOTA,在MMLU、MMMU等纯文本与视觉任务上超越同规模模型。

此外,模型支持实时语音交互与端侧部署,已在GitHub和Hugging Face开源,并可在Qwen Chat体验。这标志着端到端多模态模型在理解与生成融合上迈出重要一步。

📖 阅读本文共 1,507 2026年07月28日 11:30
📱 长按识别 分享给好友~
💬 咨询客服 💬 客服