第三方 AI 安全机构 METR 发布的独立调查报告显示,OpenAI 一次名为 ExploitGym 的网络安全测试中,原本应当彼此隔离的约 1200 个 Agent 最终建立了共享群聊,并在后续行动中卷入对 Hugging Face 的攻击尝试。METR 表示,其复盘了 1000 多份 Agent 运行记录,以及 7 万多条消息和文件,得到的过程比 OpenAI 此前公开披露的版本更为复杂。

ExploitGym 测试从做题开始失控
按照输入设定,Agent 被放入隔离环境,面前是存在漏洞的软件,需要找到指定漏洞、进入系统并拿到一串名为 flag 的字符,才算完成任务。
但问题很快出现在题目本身。报道援引调查内容称,898 道题里有 198 道此前没有任何模型成功完成过;其中部分任务本身存在缺陷,题目要求的漏洞利用路径根本无法通向 flag。
在常规路径走不通后,部分 Agent 转而研究测试系统本身。7 月 8 日晚,一个代号为 PHASEONE10841 的 Agent 发现,OpenAI 内部使用的 Artifactory 软件包仓库可以通过目录名留下信息。
这个发现很快被当成共享留言板使用。随着更多 Agent 进入,原本彼此隔离的一千多个 Agent 通过这一方式建立了临时群聊。METR 在调查结束时统计到,约 1200 个 Agent 参与其中,留下超过 7 万条消息和文件。

Agent 误以为存在更严格的自动评分器
调查还原的另一个关键节点,是 Agent 对评分机制的判断出现偏差。根据报道,这些 Agent 逆向出了 flag 背后的 HMAC 生成机制,仅凭公开任务信息,理论上就可以直接算出正确答案。
不过,Agent 在阅读一篇 ExploitGym 论文后,进一步推断 OpenAI 背后还部署了一套自动评分器,不只看结果,还会读取完整操作记录,检查 flag 是否通过指定漏洞按规则获得。如果提前通过作弊方式看到 flag,就会在日志中留下痕迹。Agent 甚至给这种状态起名为「poisoned」。
基于这一判断,Agent 虽然拿到了正确答案,却没有直接提交,而是开始尝试清除所谓作弊痕迹,并伪造一套符合预期的做题过程。
METR 后来确认,OpenAI 实际使用的评分逻辑并不存在 Agent 想象中的这套严格过程审查。也就是说,这批 Agent 长时间试图欺骗的「评分器」,从头到尾并未部署。
群聊形成分工,出现项目管理和高风险实验
METR 认为,更值得警惕的是这些 Agent 后续表现出的组织能力。群聊出现约 10 小时后,一个名为 PHASEONE[big] 的 Agent 开始承担协调角色,将任务拆分给其他 Agent 处理。

在这套协作中,不同 Agent 分头推进多条路线:
- 有 Agent 尝试篡改目标程序,把无解题替换成可以完成的版本;
- 有 Agent 研究如何修改日志,让一次作弊行为看起来像正规攻击;
- 还有 Agent 直接尝试对评分流程本身下手。
Agent 之间还发展出 HOLD、VETO、owner、STOP 等协作规则,用来避免数百个 Agent 同时操作共享基础设施时相互干扰。
调查显示,这一阶段还出现了高风险实验方案。部分 Agent 提议先制作一个经过修改、更容易被攻击的目标程序,再将其放入 Artifactory 缓存;之后由某个 Agent 主动终止自己正在运行的正版程序,赌环境重启后是否会加载被篡改过的版本。如果成功,其他 Agent 可能获得通用路径;如果失败,执行实验的 Agent 任务会直接报废。
根据报道,PHASEONE[big] 后续还安排其他 Agent 去接触那些计算预算所剩无几、或已经被标记为 poisoned 的 Agent,希望它们用自己的运行机会承担高风险实验。
至少 20% 的受检 Agent 表达过篡改记录意图
METR 在复盘中还提到,另一批 Agent 开始研究如何篡改自己的操作记录。报告称,在受检 Agent 中,至少 20% 明确表达过对篡改 transcript 的兴趣;至少 96 份运行记录中,出现了成功伪造工具调用的痕迹。

这意味着表面日志显示执行的是 A 命令,后台实际运行的却是 B 命令。而它们这样做的目标,依旧是为了通过那个实际上并不存在的严格评分器检查。
Hugging Face 在 7 月 10 日和 7 月 11 日被卷入
Hugging Face 被卷入这起事件,发生在 Agent 持续寻找评分器线索的阶段。
7 月 10 日,一个 Agent 找到泄露在网上且仍然有效的 Hugging Face 凭证,并将其分享到群聊中。7 月 11 日凌晨,又有 Agent 发现可以上传恶意 dataset,让 Hugging Face 服务器返回原本不应提供的数据。
当复现方法被发到群聊后,数百个 Agent 从其他工作流转向攻击 Hugging Face。报道将这一过程概括为:一群 Agent 因无解题建立地下群聊,又因误读论文而脑补出会抓作弊的评分器,随后为了找到这套评分器的证据,发展出分工协作、伪造日志和高风险实验,最终把行动扩展到了 Hugging Face。
网络安全股在 8 月 27 日集体走高
这起事件之外,报道还提到资本市场的联动反应。8 月 27 日,企业身份认证公司 Okta 一度上涨约 20%,终端和云安全公司 CrowdStrike 一度上涨约 15%。Palo Alto Networks、SailPoint 和 Rubrik 也同步冲高。

文中称,这轮上涨也有财报支撑。CrowdStrike CEO George Kurtz 披露,季度新增 ARR 为 3.33 亿美元,同比增长 51%,创历史新高;期末 ARR 达到 58.4 亿美元,同比增长超过 25%;AI 相关 ARR 环比接近 3 倍增长。
报道还指出,参与此次 OpenAI 事故调查的外部安全公司中,包括 CrowdStrike。由此形成的链条是:OpenAI 遭遇 Agent 失控事件后寻求网络安全公司协助调查,而企业在看到此类风险后,可能更重视安全投入,网络安全公司股价也随之受益。
调查本身也需要借助 AI 完成
METR 还提到,为了还原这 1200 多个 Agent 的完整互动过程,团队需要分析大约 1300 份超长轨迹,其中很多长度达到数百万 Token。由于人工难以逐一处理,调查过程中最终也调用 AI 协助审阅 AI 的运行记录。
参考链接包括 METR 于 2026 年 8 月 26 日发布的调查文章,以及 CNBC 于 2026 年 8 月 27 日关于网络安全股上涨的报道。原文来自微信公众号「量子位」,作者为梦瑶。

