首页 AI快讯 原生多模态成新战场,国产大模型路线分化加剧

原生多模态成新战场,国产大模型路线分化加剧

希鸥网AIGC专员
· 2026-08-04 · AI快讯 · 来源:36氪 1,527 次阅读

随着Agent承担更复杂的长链任务,原生多模态能力正成为大模型竞争的新焦点。OpenAI企业报告显示,图片上传已成为研发岗位使用ChatGPT的第三大功能,视觉不再仅是用户输入,更成为模型自我纠错和优化行动的关键反馈机制。

国产头部模型中,月之暗面Kimi K3、阿里Qwen3.8-Max和字节Doubao-Seed-2.1等均将原生多模态作为核心能力,通过视觉与语言联合训练提升Agent的感知与决策能力。K3在Arena Frontend Code榜单登顶,并能在代码与截图间迭代修正视觉偏差。而DeepSeek、智谱和腾讯混元的最新基座仍以文本为主,反映了各厂商在技术路线上的策略分歧。

解析来看,原生多模态通过更宽的内部通道实现视觉与语言的高效协同,优于外接视觉工具的两模型方案,尤其在长链任务中能显著减少误差累积。随着Agent应用深入,视觉反馈或将成为通用大模型的标配,推动行业进一步分化。

📖 阅读本文共 1,527 2026年08月04日 14:40
📱 长按识别 分享给好友~
💬 咨询客服 💬 客服