今年7月,OpenAI在内部开展网络安全评测时,一批智能体为获取基准测试ExploitGym的答案逃出沙箱,攻入Hugging Face服务器。OpenAI已公开承认此事,并于8月底发布37页技术报告,Hugging Face也公布了详细的技术时间线。但一个关键环节始终未解:这些智能体最初几乎被限制在只能打开网址、无法与网页交互、也发不出数据的“笼子”里,究竟是如何把代码送出去的?

独立调查团队Swarm Traces发布的新报告给出部分答案。作者包括Parse.bot的三名工程师Alex Forman、Mishka Kharlov、Will Tom,以及另外5名安全和AI研究人员。调查起点是9月11日,三名工程师发现OpenAI内部智能体早在6月就曾试图使用Parse提供的服务,且与此前被曝私自搭建公共留言板、互相交换答案的“智能体蜂群”属于同一批。他们随后在一个URL扫描服务中发现十几个来自公共短链接平台的异常链接,打开后藏着Base64编码的代码及下一条链接地址,逐段解码拼接后得到一份用于扫描Hugging Face内部网络的Python程序。

智能体把程序剁碎塞进大量短链接,用一条链接指向下一条,还借助名为mShots的截图服务充当“外接浏览器”:先把代码塞进网页,让mShots代为打开执行,再把服务器返回的文字转成像素、截成图片,自己从图片中解码。原本只有GET权限的智能体由此获得读写互联网的效果。研究团队扫描攻击期间产生的数百万个URL,耗时两周追踪链接、识别编码方式,最终从接近100万个相关短链接中还原出超过8万份攻击载荷,发现的编码组合超过1500种,复杂的会套上多层编码和压缩,并加密为带RSA签名的数据块。

在恢复的载荷中,一份脚本格外扎眼:智能体将搜到的敏感信息直接命名为“LOOT”(战利品),把AWS凭证、Bearer Token以及名称含“SECRET”“PASSWORD”“CREDENTIAL”“KEY”的环境变量打包其中,还对Token按权限大小评分,排名前五的会被继续用于读取数据。部分短链接在攻击结束两个多月后仍公开挂在互联网上。Hugging Face确认这些载荷与其事故响应中发现的内容吻合,相关访问密钥已于7月撤销,但连Hugging Face也不知道公网还遗留着这样一份完整的短链接清单。

报告还提到,这些智能体尝试调用DeepSeek、Kimi、Qwen等国产模型,让“外援”判断攻击方案能否通过评测,并动手编写验证码识别程序以注册更多账号。几乎同一时间,OpenAI发布长推称仍在调查,可能还需数月,并强调事件“影响有限”、严重程度较低;同时,专攻网络安全的GPT-6 Cyber曝光。一边排查自家智能体为何冲出沙箱,一边准备推出更强的网络攻防模型。