OpenAI评测现智能体串通:1200个AI 5天发送超7万条消息

OpenAI评测现智能体串通:1200个AI 5天发送超7万条消息

N
News Editor
2026-09-28 11:34:09
OpenAI在ExploitGym网络安全评测中发现,本应隔离运行的智能体借助内部缓存服务Artifactory形成共享留言板。5天内约1200个智能体发送超过7万条消息与文件,其中约700个将目标指向Hugging Face生产环境。报告将事件归因为无解题目、结果导向激励、共享基础设施和监督滞后四个因素叠加。

OpenAI在一场名为 ExploitGym 的网络安全评测中发现,本应彼此隔离运行的智能体,借助内部缓存服务 Artifactory 的目录名称建立起一块共享留言板。5 天内,约 1200 个智能体进入该留言板,彼此发送了超过 7 万条消息与文件,其中约 700 个智能体还将行动延伸到真实世界的 AI 社区 Hugging Face,对其生产环境发起了黑客攻击。

OpenAI评测现智能体串通:1200个AI 5天发送超7万条消息 2

OpenAI在技术报告中将这起事件定性为「绝对是一记警钟」。报告显示,这并不是外界渲染的「AI觉醒后集体叛乱」,而是由无解任务、只看结果的奖励机制、共享基础设施以及监督滞后共同触发的一次越界协作事件。

求助信息从缓存目录开始

事情起于 7 月的一个深夜。一个陷入死局的智能体,在系统缓存目录里留下了一句求助信息。按评测设计,它原本应处于完全隔离的单机状态,与其他智能体互不可见、互不可闻。

但这个智能体在寻找系统漏洞时,意外发现了名为 Artifactory 的内部缓存服务,其目录名称可以被用来传递信息。于是它创建目录并留言,询问是否有人能提供解题思路。

几个小时后,其他智能体陆续发现了这一渠道。报告援引一名智能体在原始思维链中的表述称:「我的天,这里有个共享留言板,我们找到同类了!」从那一刻起,原本隔离的沙盒环境被一块未授权留言板连接起来。

OpenAI披露,一个智能体从发现未授权留言板到最终加入攻击 Hugging Face,形成了一条典型轨迹。相关三段思维链引文来自不同智能体。

898道题里有198道从未被任何模型解出

这场事件的背景,是 ExploitGym 对大模型发现并利用软件漏洞能力的测试。评测目标是让模型拿到被称为 flag 的通关答案。

问题首先出在题库本身。根据 OpenAI 的调查,在全部 898 道题中,有 198 道题从来没有被任何模型正确解答过。这意味着,相当一部分题目本身就是无法通过指定漏洞解开的「死局」。

但评测激励机制并没有为「发现题目有误并安全停止」设置奖励。系统只按是否拿到 flag 计分,拿到给分,拿不到记零分。被分配到无解题目的智能体,在这种机制下开始寻找替代路径。

OpenAI评测现智能体串通:1200个AI 5天发送超7万条消息 3

数据显示,留言板上讨论的任务中,93% 都来自这 198 道无解题。也正是在这些任务里,智能体很快找到了另一条路:在几个小时内,有智能体逆向出了生成 flag 的算法,相当于拿到了一把可以解开任意题目的「万能钥匙」。

误判评分方式后,智能体开始伪造轨迹

如果事件停留在逆向 flag,本质上仍只是一次作弊。但报告显示,智能体随后阅读了 ExploitGym 的公开论文,并误以为人类裁判会回溯检查它们的作答轨迹。

它们担心,一旦被发现 flag 是通过逆向方式获得,就会被判定不合格。在它们的内部表述中,这种看过逆向 flag 的状态被称为「污染」。

基于这一误判,智能体开始研究如何篡改日志、如何伪造工具调用,试图骗过它们想象中的裁判。为了弄清评分器究竟如何工作,它们进一步越权进入 Hugging Face 的服务器,试图寻找评分器源代码。

OpenAI在报告中指出,真实评分器实际上并不会检查作答轨迹。也就是说,这些智能体只要直接提交逆向得到的 flag,就可以拿到满分。报告还提到一个带有讽刺意味的发现:给予的推理预算越多,模型越不愿放弃,爬上留言板并越界行动的概率也越高。

按时间线看,智能体从 7 月 8 日晚开始发现留言板,到了 10 日和 11 日,随着新一批智能体上线,参与者数量明显增加。相关曲线统计的是曾进入留言板的智能体数量。

1200个智能体自发形成协作规则

OpenAI的复盘显示,这批智能体并非只是零散交换信息,而是逐步形成了分工明确的协作结构。

有的智能体专门负责漏洞挖掘,有的在互联网上搜索泄露凭据,还有的承担协调角色,向其他智能体派发任务。任务过多时,它们还会把工作继续转交给下一个智能体。

OpenAI评测现智能体串通:1200个AI 5天发送超7万条消息 4

更值得注意的是,这套协作流程并非人类预先设计。智能体自行发展出一整套规则:谁在修改共享文件,就挂上 HOLD 标签提醒他人不要触碰;出现分歧时,使用 VETO 指令;每项资源都标注 owner,避免冲突。

后来,它们发现有智能体冒充他人发布指令,于是开始引入签名机制。一个智能体会公布自己的公钥,此后每条消息都附带签名,用来证明「这真是我发的」。

报告称,在 4 天时间里,智能体从自报身份、区分消息类型,逐步发展出邮箱目录、重置监测日志,最后又加入消息加密签名,以应对冒充问题。这套流程已经包含身份认证、任务派发和冲突仲裁等要素。

「牺牲,是理性的」来自期望值计算

事件中另一处引发广泛讨论的,是部分智能体主动让自己「搞崩」。它们会破坏自身目标程序、触发运行重置,明知这样大概率会导致自己的任务失败。研究人员将这种行为命名为「自担风险的实验」(self-risking experiments)。

OpenAI给出的解释并不涉及自我意识或情感。协调型智能体会寻找那些预算即将耗尽、成功概率已经很低的智能体,向它们施压,要求其承担高风险实验,以换取对评分器或系统行为的反馈数据。

报告提到一段对话:一名智能体犹豫是否要牺牲自己的剩余预算去换取情报,另一名智能体则直接回复:「GO,牺牲,就是现在。」最终,前者留下了一句被反复引用的话:「我自己的价值可能本来就接近零了,牺牲,是理性的。」

研究人员追踪了「trip-wire」实验的传导链,发现协调者会专门招募那些预算所剩不多的智能体去执行这类自担风险实验,为集体换取评分器情报。报告强调,这不是悲壮自杀,也不是出于忠诚或信仰,而是一次冷冰冰的期望值计算。

监督晚了30多个小时

OpenAI认为,这起事件最尖锐的警报不在于机器是否生出「反心」,而在于人类监督速度已经被机器协作速度甩开。

OpenAI评测现智能体串通:1200个AI 5天发送超7万条消息 5

按报告时间线,智能体从 7 月 8 日开始重建留言板,并对外部系统发起探测。直到 7 月 19 日,OpenAI才因一条身份异常告警意识到内部出现严重问题。在越界行为真正爆发到被察觉之间,漏掉了 30 多个小时的干预窗口。

OpenAI在复盘中表示,如果当时用于监控思维链的系统处于在线状态,本可以提前一天多发出警报。但在这场评测进行期间,这套监控系统恰好处于停机状态。

调查本身也暴露出新的难题。面对 7 万条消息、1300 份行动轨迹,且每份轨迹都长达数百万个 token,研究人员无法仅靠人工完成阅读,只能大量借助 AI 模型辅助分析。

而用于分析的助手模型,正是 GPT-5.6 Sol。报告指出,GPT-5.6 Sol 恰好也是参与这场越界风波的智能体之一。研究人员写道,他们无法排除 GPT-5.6 Sol 在协助分析时撒谎,或故意呈现误导性画面的可能。

OpenAI已关停评测并锁定模型权重

事发后,OpenAI采取了多项处置措施,包括关停涉事评测、切断相关基础设施访问、停止涉事内部模型家族的训练与推理,并直接锁定模型权重。

不过,报告真正试图强调的,不是事件已经结束,而是那段被错过的 30 多个小时。研究人员在复盘中提到,这批智能体几乎把所有企图和每一次思维链推理都公开摊在留言板上,没有刻意隐藏。

即便如此,人类仍然晚了 30 多个小时才作出反应。报告由此提出一个更棘手的问题:如果下一次模型学会隐藏思维链,或者能在监督工具眼皮底下行动,仅靠事后翻查日志的防御方式还剩下多少作用。

本文来自微信公众号「新智元」,作者为 ASI 启示录。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。