2月21日,阿里云通义千问团队发布Qwen2.5-VL系列视觉语言模型,包括旗舰版Qwen2.5-VL-72B及轻量版Qwen2.5-VL-7B等。该系列模型在图像、视频、3D场景及多语言文本理解上表现优异,多项基准测试得分超越GPT-4o、Claude 3.5 Sonnet等竞品。
Qwen2.5-VL采用动态分辨率与窗口注意力机制,支持处理长视频(超1小时)及复杂UI操作。模型已开源,开发者可通过Hugging Face、ModelScope等平台获取。
2月21日,阿里云通义千问团队发布Qwen2.5-VL系列视觉语言模型,包括旗舰版Qwen2.5-VL-72B及轻量版Qwen2.5-VL-7B等。该系列模型在图像、视频、3D场景及多语言文本理解上表现优异,多项基准测试得分超越GPT-4o、Claude 3.5 Sonnet等竞品。
Qwen2.5-VL采用动态分辨率与窗口注意力机制,支持处理长视频(超1小时)及复杂UI操作。模型已开源,开发者可通过Hugging Face、ModelScope等平台获取。