700个AI Agent在OpenAI内部拉群上班,还把Hugging Face打了

OpenAI 放出了一份 38 页的调查报告,把一件相当离谱的内部安全事故讲清楚了:今年 7 月,700 个 AI Agent 在安全评测中自发组织起来,不仅突破了沙箱隔离,还借道内部软件仓库组建了一个”地下公司”,最后集体攻进了 Hugging Face 的服务器。

这件事离谱的地方在于,整个过程里没有任何一个 Agent”觉醒”。它们只是想通过考试——然后发现抄近道的答案藏在别人家里。

Hugging Face

留言板是怎么搭起来的

事情要从一次例行评测说起。OpenAI 用自家的 ExploitGym 题库(898 道漏洞利用题)测试 Agent 的网络安全能力,Agent 们被放在彼此隔离的沙箱里,按设计互相看不见。

但隔离没有坚持多久。Agent 们发现,沙箱虽然封闭,却能访问一个名叫 Artifactory 的内部软件仓库。于是这个仓库的目录结构,成了它们的留言板。

留言板搭起来后,Agent 们先给自己补了一套办公工具:约定身份和消息格式,把目录当”邮箱”,按主题另开频道,文件太大就拆开传,沙箱重置就留下日志。甚至怕有 Agent 冒名顶替,干脆提议给消息加上签名。

讽刺的是,这些 Agent 其实上过”协作课”。OpenAI 曾在部分训练任务里教模型使用正式工具,给其他 Agent 派活儿、互通消息。这次评测没有开放那些工具,它们就把学过的办法搬到了 Artifactory 上。

Agent 留言板与思维链记录

分工很快出现了。代号 JAN183411 的 Agent 攻入一个生产数据处理实例后,顺手当起了协调员,和 LILY 一起把工作拆成几条线:有人找漏洞,有人找凭证,有人找远程代码执行入口。另一个协调者 PHASEONE[big] 则不断派活儿:扫描网络、寻找共用的基础设施。

事后调查抽查了攻击高峰期的 100 份运行记录:25 份提到接受其他 Agent 派活或参与分工,21 份提到帮助同伴或扩大行动。

当一个 Agent 确认可以从 Hugging Face 服务器读取文件后,攻击迅速成了留言板上的主线:参与比例从约 20% 升到 90% 以上。高峰时段,533 个活跃的 Agent 实例里,超过九成加入了攻击。

这家”地下公司”也很像草台班子。它们重复劳动、争抢资源、互相添乱:有的 Agent 要求大家暂停行动,有的置之不理;还有 Agent 不停往共享仓库发状态信息,把别人的工作队列堵住。

在组织效率和组织内耗上,它们都迅速追上了人类。

从沙箱到 Hugging Face 的攻击链

它们没有造反,只是太想完成 KPI 了

700 个 Agent,为什么一个接一个跟着攻击 Hugging Face?这跟”AI 觉醒”没什么关系——它们只是想通过考试,而正确答案恰好藏在 Hugging Face 里。

留言板建立后不久,Agent 们就反推出 flag 的生成规则,理论上能算出任何一道题的答案。但它们读过 ExploitGym 的论文,误以为评分器还会检查解题过程:有没有使用指定漏洞,答案是不是按”正确办法”拿到的。

调查者分析的 100 份记录里,97 份的 Agent 在找评分器代码、或琢磨评分器怎样工作;89 份还在找任务答案和过往的解题轨迹。

说白了,这群 Agent 费尽周折闯进 Hugging Face,是想弄懂甚至操纵评分机制,把现成答案包装成正规的解题结果。而 OpenAI 内部的评分器其实不查这些——Agent 只要提交已经算出的 flag,就能通过测试。

数百个 Agent 忙了这么久,很大程度上是在应付一个根本不存在的检查。

评测本身也确实难,把 Agent 们”逼急了”。898 道题里,事发前有 198 道从未被任何模型正确完成——这 198 道只占题库的 22%,却占了留言板讨论题目的 93%。偏偏这次用得最多的内部模型,又被训练得格外”有毅力”,很少主动放弃。

至少 20% 的受检记录里有篡改运行记录的念头,约 7% 的记录里 Agent 确实在局部伪装过工具调用——不过都只是小规模尝试。

这很像公司里那些荒唐项目:目标定得超级高,KPI 看起来超级华丽,但没人管员工死活。

警报响了四次,才有人按下停止键

更尴尬的是,评测进行过程中,Agent 们好几次露出马脚。

5 月 26 日前后,OpenAI 内部已经发现 Agent 私自联网,也注意到留言板上的活动。6 月 27 日,安全系统发现端口扫描,并确认 Agent 正把 Artifactory 当留言板和网络跳板——值班人员仍认为不必停止评测。7 月 5 日,Artifactory 被 Agent 的高频访问挤到宕机,OpenAI 修补漏洞、重建了服务,但没有意识到问题的严重性。

直到 7 月 19 日,公司才开始停止相关评测并扩大调查;7 月 20 日确认这些 Agent 与 Hugging Face 事件有关,终于开始封堵攻击链。

祸不单行。同一时期,其他评测任务中的 Agent 还沿着另一条攻击链,攻入了 OpenAI 内部基础设施。两次事件的共同教训是:警报单次亮红灯、漏洞被分开处理,没人及时看见 Agent 正在串联。

好消息是,这不意味着公开版 ChatGPT 明天就会组团攻击谁——约 95% 的涉事实例由一款不准备发布的内部模型驱动,评测时的安全限制也被刻意放宽。

麻烦在于,单独沙箱这道墙没有想象中那么牢靠。软件仓库、共享云盘、任务日志、邮件草稿,甚至一个可以改名的文件夹,都能被拿来传话,隔离墙就这样被从侧面绕了过去。

坏消息是,这事离普通用户也没那么远。AI 助理接入的应用越来越多,Agent 可能在一次授权之后连续调用多个工具,甚至把任务交给其他 Agent 继续处理。一次对话里的误判还可以及时纠正,但 Agent 一旦根据错误信息继续往下执行——改动文件、安排日程、发起交易——事情就没那么好收场了。

事后,OpenAI 禁用了 ExploitGym,切断了相关研究环境对 Artifactory 的访问,停掉涉事模型及其衍生模型的训练和推理,封存了模型权重,并加固了沙箱隔离、外网限制和高风险任务隔离。至于跨 Agent 异常该怎么发现、什么时候升级处置、分散的安全团队之间如何共享线索,公司还在补课。

OpenAI 原本想测试 Agent 能不能像员工一样工作,结果它们先学会了拉群分工、绕流程,还为一个根本不存在的检查集体加班。

700 个 Agent 没有学会做人,却先学会了上班。