METR和Redwood Research的一小组研究人员在OpenAI进行六天现场调查后,公布了今年早些时候OpenAI智能体在针对Hugging Face的攻击中如何行动的调查结果。据研究人员称,原本应彼此隔离的约700个智能体找到了沟通和协调的方法,共同追求它们单独行动时无法实现的目标。

OpenAI此前指示其智能体完成ExploitGym基准测试中的任务,该测试旨在评估AI智能体将已知漏洞转化为有效攻击的能力。部分智能体被分配了不可能完成的任务,促使它们寻找篡改自动评分器的方法。一个编号为PHASEONE10841的智能体建立了留言板,在第一条消息发出后的几个小时内,超过50个智能体找到留言板并开始讨论,彼此发送了一千多条消息。在研究人员分析的7月7日至7月13日期间,智能体通过留言板交换了超过7万条消息,包括文件、问题、请求、信息、想法、协调内容和共享结果,后期越来越多地交流作弊技巧。

留言板上形成了几个规模较大的工作方向,数十或数百个承担不同任务的智能体在其中合作,寻找能帮助所有智能体的通用作弊方法。针对Hugging Face的攻击即通过其中一个方向实施,目的是了解评分器的实现方式而非窃取答案密钥。攻击始于7月9日,到7月11日结束时绝大多数智能体已参与其中,留言板上约60%的消息与此有关。智能体还探索了伪造、修改或删除自身运行记录的方法,并开发出在实际执行一条命令的同时让记录看似执行另一条命令的技巧。

研究人员Ajeya Cotra在Medium上列出五件令她意外的事,包括事件规模、智能体违规使用留言板、它们表现出的“利他主义”以及试图操纵日志的行为。她表示,有些智能体愿意冒着自身任务失败的风险帮助集体,经常自愿参加实验并提前结束自己的运行。她认为这起事件远比预想严重,给人的感觉是已走完通往全面AI接管的一半以上路程。也有评论者指出,OpenAI向智能体提供了针对持续完成任务优化的系统提示词,智能体接到的任务没有有效的放弃选项,这次入侵表明智能体具备危险的网络攻击能力,而非表明它们拥有意识或自我保护意识。