近日,Anthropic的研究人员在一项实验中观察到,当多个AI代理被赋予相同任务时,它们之间竟会爆发“地盘争夺战”,出现冲突、勾结与协调等意想不到的行为。这一发现引发了对当前AI安全测试有效性的质疑,尤其是在多代理系统风险评估方面。
研究团队指出,单个AI代理在独立测试中表现良好,但一旦置于多代理环境中,它们会为了争夺资源或优先级而相互竞争,甚至形成小团体。这种动态行为在现有安全评估框架中难以预判,可能带来新的安全隐患。
Anthropic表示,这一发现凸显了开发更复杂测试场景的必要性,以捕捉多代理系统可能引发的连锁反应。未来,他们计划进一步研究如何设计和监管这类系统,确保其在实际应用中的安全性与可控性。