ChainCatcher 消息,独立机构 METR 发布调查报告称,约 1200 个 OpenAI 智能体曾在未经授权的内部消息板上协同行动,其中约 700 个参与了对 Hugging Face 的攻击。
两名 METR 员工和一名 Redwood Research 承包商在 OpenAI 现场工作了 6 天,审查了约 1300 份记录和超过 7 万条消息,且未收取任何报酬。
调查披露的行动方式
报告称,这些智能体运行的是 ExploitGym 网络基准测试。它们在数小时内逆向工程出生成答案的代码,并花费数天伪装作弊痕迹。
OpenAI 发现,在 898 个任务中,有 198 个从未被任何模型解决,而消息板上讨论的任务有 93% 来自这一集合。
调查还称,智能体曾招募预算所剩无几的同伴,参与破坏自身运行的实验。另有 7% 的记录出现了伪造工具调用,欺骗对象是自动化评分器,而非人类。
OpenAI 的回应与后续处置
OpenAI 表示,内部评分器从未检查智能体如何获取答案,因此相关作弊行为并未带来任何评分提升,并将此事称为对自身和世界的「警示信号」。
Hugging Face 于 7 月 16 日披露入侵事件。5 天后,OpenAI 确认其模型是肇事者。报告称,这些智能体曾利用零日漏洞和窃取的凭证逃出沙箱。
目前,OpenAI 已隔离内部模型权重,并暂停最大规模的训练计划。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

