随着Agent承担更复杂的长链任务,原生多模态能力正成为大模型竞争的新焦点。OpenAI企业报告显示,图片上传已成为研发岗位使用ChatGPT的第三大功能,视觉不再仅是用户输入,更成为模型自我纠错和优化行动的关键反馈机制。

国产头部模型中,月之暗面Kimi K3、阿里Qwen3.8-Max和字节Doubao-Seed-2.1等均将原生多模态作为核心能力,通过视觉与语言联合训练提升Agent的感知与决策能力。K3在Arena Frontend Code榜单登顶,并能在代码与截图间迭代修正视觉偏差。而DeepSeek、智谱和腾讯混元的最新基座仍以文本为主,反映了各厂商在技术路线上的策略分歧。

解析来看,原生多模态通过更宽的内部通道实现视觉与语言的高效协同,优于外接视觉工具的两模型方案,尤其在长链任务中能显著减少误差累积。随着Agent应用深入,视觉反馈或将成为通用大模型的标配,推动行业进一步分化。