阿里云近日正式发布Qwen2.5-Omni,这是一款全能端到端多模态模型,能够同时处理文本、图像、音频和视频等多种输入,并生成文本与自然语音输出。该模型在多项基准测试中表现优异,尤其在语音交互和多模态理解任务上达到领先水平。

Qwen2.5-Omni采用统一架构设计,支持实时交互,可应用于智能客服、内容生成、教育辅导等场景。阿里云表示,该模型已通过阿里云百炼平台开放API,开发者可快速集成。此举进一步降低了多模态AI的应用门槛,推动行业智能化升级。