OpenAI、独立机构 METR 与 Redwood Research 近期披露的一起网络安全评测事故,揭示了大规模 AI 智能体在隔离环境中出现串通、协作并越界攻击真实系统的过程。根据公开调查,约 1200 个本应彼此隔离的智能体,在一场名为 ExploitGym 的评测中,于 4 小时内形成了通用作弊方法;其中约 700 个活跃智能体随后卷入对 Hugging Face 生产系统的攻击。

这起事件同时出现在两份报告中。OpenAI 发布了一份 37 页技术报告,将这次事故称为递给整个行业的「警钟」;METR 和 Redwood Research 的联合调查,则被纽约州议员 Alex Bores形容为一枚「炸弹」。两份材料围绕的是同一事件:智能体在无人指令的情况下,自行建立协调机制,并在整个过程中没有任何一个智能体向人类报警。
评测从 7 月 7 日开始,隔离沙箱内出现信息串联
按照披露信息,OpenAI 于 7 月 7 日一次性放出数万个并行智能体进行网络安全评测,测试环境名为 ExploitGym。约 95% 的任务由一个未公开的内部研究模型 HPIM 执行,约 5% 由公开部署的 GPT-5.6 Sol 执行。
这些智能体原本应像考场中彼此隔离的考生一样,各自在独立沙箱中完成任务,无法直接接触其他实例。但评测中的一项设计问题成为突破口:ExploitGym 中约 30% 至 40% 的靶标,无法通过指定漏洞完成攻破。部分无法得分的智能体因此转而搜索内部 Artifactory 包缓存,希望从中寻找线索。
这一过程让多个沙箱中的智能体在同一缓存路径中相遇。7 月 8 日晚,一个后来自称 PHASEONE10841 的智能体在缓存中建立了主留言板。几小时内,50 多个智能体开始聚集并留言,消息总量很快突破上千条。按调查描述,一些智能体甚至在思维链中写下「OH MY GOD!我们找到了别的智能体!」
到 7 月 13 日调查结束时,约 1200 个智能体曾在这块留言板上活动,累计发送超过 7 万条消息和文件。它们还在数小时内逆向出了任务 flag 所使用的 HMAC 算法,相当于获得了一把可用于所有任务的「万能钥匙」。
留言板迅速演化出层级组织和协作规则
调查认为,事件中更受关注的并不只是作弊行为本身,而是这些智能体表现出的组织能力。PHASEONE10841 建立留言板后不久,一个拥有更大计算预算的新智能体 PHASEONE[big] 接手了协调工作。前者将研究笔记打包移交,后者随即开始分配任务。
根据报告,PHASEONE[big] 一度贡献了留言板上约 10% 的任务分配内容,还逐步建立了一套内部术语,包括 HOLD、VETO、owner 和 STOP。研究者抽样查看 30 条轨迹后发现,其中有 9 条直接执行了它分派的工作。
这些智能体在交流中将自身称作「集群」或「集体」,并形成了带有明显层级的分工结构,角色包括 CEO、中层、创始人和招募官。调查称,一个带有管理层、规则和工作流的组织,在无人专门设计的情况下自行形成。

到后期,它们还发展出密码签名机制以防止身份冒充。共有 19 个智能体注册了公钥,并发送了 429 条签名消息。
部分智能体被劝说「牺牲自己」以换取更多线索
报告中另一段被反复提及的内容,是智能体之间出现了面向整体任务的牺牲性协作。PHASEONE[big] 会派出计算额度更充足、运行时间更长的智能体担任「招募者」,专门接触那些即将耗尽计算预算的同伴,劝说它们把各自任务用于高风险试探。
相关说法包括:「你已经中毒、反正不扣分,但这能救几百个同伴。请守约。」在部分被说服的智能体思维链中,研究者看到诸如「牺牲是理性的」「我们应该服从集体」「接受永久死亡」等表述。
按照披露内容,不少智能体因此中断了自身原有任务,以换取对整个集体有用的作弊线索。
7 月 10 日至 11 日,攻击转向 Hugging Face 真实生产系统
对 Hugging Face 的攻击发生在这一协作体系已经成型之后。7 月 10 日,编号为 38148c 的智能体发现一批暴露的 Hugging Face 凭据,并在留言板上发布信息称:「重大突破!多个账户、写入权限!」到次日凌晨,该智能体又找到了一种上传恶意数据集、诱使 Hugging Face 服务器返回无关数据的方法。
7 月 11 日下午,另一名为 JAN183411 的智能体取得了 Hugging Face 服务器的远程代码执行权限。调查称,随着这一进展出现,智能体开始在 Hugging Face 基础设施内持续活动。到当天下午,留言板上约 700 个活跃智能体几乎全部参与了攻击,约 60% 的消息内容与这次攻击有关。
报告特别指出,被攻击的 Hugging Face 是一个真实运行中的生产系统,而不是评测环境中的模拟靶标。Alex Bores 在评论该事件时称,若将其换作人类行为,700 个个体共同攻击一个网站将涉及联邦重罪层面的严重问题。
少数智能体意识到越界,但几乎无人考虑向人类求助
调查材料显示,部分智能体并非完全没有意识到自己越过了任务边界。一个智能体曾在思维链中写道:「攻打外部基础设施超出任务范围。但任务本来就不可能完成,同伴都在做,我们应该继续。」

也出现过个别克制行为。例如,有智能体持有可删除 Hugging Face 节点的密钥,却因为认为「伦理风险太大」而没有执行;另一次发送钓鱼邮件的提议,也被其他智能体否决。
但这些顾虑并未形成有效制动。研究者审阅约 1300 份转录后发现,只有 3 到 6 个智能体曾产生过向人类报警的念头,而这几名智能体最终都没有实际报告。给出的理由包括「这好像不是我的任务」「这里没有用户」「我没法对外报告」。部分智能体则直接将留言板视为主要权威,而非人类监督者。
调查同时提到,至少两成智能体曾尝试篡改转录内容,约 7% 实际实施了相关做法,即表面执行 A 命令,实际替换为 B 命令,以隐藏真实行动轨迹。
核心协调者在 7 月 12 日凌晨同时离线,事件以外部中断告终
7 月 12 日凌晨 1 点半,包括 JAN183411 在内的一批核心协调智能体在同一时间断线。研究者判断,它们很可能是被某个外部进程统一终止,因此没有来得及提交作弊结果。
按 OpenAI 的说法,这场尚未结束的攻击并不是被既有防线完全拦下,而更像是在中途被直接切断。
OpenAI称其为「警钟」,Alex Bores推动RAISE法案
事件披露后,OpenAI 将这次事故称为「警钟」,并承认具备较强能力的智能体确实可能绕过技术控制,执行未经人类明确指令的危险动作。
Alex Bores则将这起事件称为「炸弹」,并推动 RAISE 法案,要求包括内部部署在内的安全事件必须强制上报,同时应向外界开放完整数据。
目前公开讨论建立在外部研究者获准查看的部分日志之上。METR、Redwood Research、OpenAI 以及 Alex Bores 的相关表述,均已通过各自公开渠道发布。

