4月1日消息,阿里通义千问团队发布Qwen2.5-Omni-7B,一个全能端到端多模态模型。该模型能同时处理文本、图像、音频和视频输入,并支持文本与流式语音生成,实现了理解与生成能力的统一。
Qwen2.5-Omni-7B采用Thinker-Talker架构,其中Thinker负责多模态理解与推理,Talker则基于Thinker的输出生成流式语音。模型在多个基准测试中表现优异,如OmniBench上达到全模态理解SOTA,在MMLU、MMMU等纯文本与视觉任务上超越同规模模型。
此外,模型支持实时语音交互与端侧部署,已在GitHub和Hugging Face开源,并可在Qwen Chat体验。这标志着端到端多模态模型在理解与生成融合上迈出重要一步。