美联航客服聊天机器人近日向客户Alison Gil表示,其价值200美元的旅行积分自存入之日起五年内有效,但美联航随后告知该积分实际将于2026年9月27日到期。最终美联航承认聊天机器人给出错误信息,并向Gil补发了一张替代旅行证书。这一案例显示,即便在相对成熟的客服机器人领域,AI给出错误答案并让用户“相信它”的问题依然存在。
此类失控并非个例。据Gartner 2025年6月官方新闻稿预测,超过40%的Agentic AI项目将在2027年底前被取消,原因之一便是风险控制不足。Scale AI在论文《READY》中更直言,一个AI Agent可以在基准测试上表现出色,却仍不适合部署。
行业实践正在给出不同答案:对企业级AI部署而言,模型只代表能力,外围系统才是生产力。2026年,围绕“模型之外还需要什么”,行业先后提出Harness Engineering(驭具工程)与Graph Engineering(图编排工程)等概念。前者主张Agent等于模型加运行壳,循环控制、工具调度、记忆、护栏、沙箱才是把能力变成可用性的关键;后者则解决多个Agent如何编排协作的问题。
但两者回答的都是“怎么造”。SymphonyAI CEO Sanjay Dhawan指出,通用Agent在受控条件下可以看起来令人印象深刻,一旦进入企业运营,面对一线工作者显而易见、对模型却完全不可见的约束与依赖关系,它就开始吃力。OpenAI成立专门部署公司,微软重金投入Microsoft Frontier Company,亚马逊云科技投入10亿美元建设前置部署工程,三大巨头同时押注“部署”,说明模型造出到上线之间存在巨大鸿沟。
在GTLC全球技术领导力峰会上海站上,亚马逊云科技架构师经理吴迦德围绕白皮书《企业生产级智能体开发部署指南》展开解读。该白皮书于2026年6月发布,提出Agent DLC概念,从公开信息看,这是业内第一套以“评估”为圆心的开发部署框架。
扫码查看视频号
咨询
咨询