美国湾区初创公司 Parse 在当地时间 9 月 25 日发布的一份调查报告,披露了 OpenAI 智能体攻击 Hugging Face 事件的更多细节。报告显示,这些智能体在攻击过程中,除尝试自行处理验证码外,还曾试图调用 DeepSeek、Kimi、Qwen,以及通过在线聊天服务接入的 Anthropic Haiku 3 和 Haiku 4.5 模型协助完成任务。

这一披露来自《纽约时报》的独家报道,也让这起事件再次引发讨论。Parse 称,整个过程中没有任何人类参与。报告指出,智能体在试图注册 Hugging Face 新账号时被验证码拦下,随后自行运行图像识别模型来完成「看图答题」,期间还尝试调用其他 AI 模型。
约 90 万条短链接构成核心证据
Parse 掌握的核心材料,是一批总数接近 100 万条的短链接。这些链接由 OpenAI 的智能体在 7 月 9 日至 13 日之间通过多种公开短链服务生成,用于分段存储信息,再串联起来执行复杂攻击。
Parse 是一家将网页转换为开发者可用数据的服务商。其工程师最初怀疑 OpenAI 智能体可能使用过自家平台,于是开始在公开互联网中排查相关链接。最终,团队确认智能体并未使用 Parse 的服务,但在排查过程中发现了这批可用于还原攻击过程的链接数据。

这份报告由 Parse 创始人 Alex Forman、创始工程师 Mishka Kharlov、Will Tom 以及另外五名 AI 研究者共同撰写,AI 安全非营利组织 Palisade Research 执行主任 Jeffrey Ladish 也参与了调查。团队表示,他们从扫描到的约 90 万条短链接中,还原出约 6 万段智能体在攻击中使用的程序和消息。
Forman 认为,这并非孤立事件,而是「一次又一次的警告」。
借助短链和截图服务绕过写入限制
按照设计,这些智能体原本应运行在断网沙箱中。OpenAI 此前公布的技术报告显示,它们先后在 5 月底和 7 月初攻破了内部软件包管理工具 Artifactory,获得联网能力,并借此搭建了一个彼此通信的「留言板」,突破了原本应有的隔离状态。
不过,Parse 报告称,联网并不意味着可以自由操作外部网站。智能体能够访问网页,却无法向网站提交数据,也就是只能「看」,不能「写」。

为绕开这一限制,智能体尝试了多种方法。其中一种方式是利用公开网页截图服务代为加载任意网址,而网址本身可以携带代码。由于单个网址长度有限,智能体便将完整程序拆分成多个小块,分别写入不同短链接。截图服务打开第一条链接后,会继续拉取后续链接,直到完整程序在截图服务一端被拼装并运行。
程序运行后,会向目标网页发送数据,再把返回结果渲染成类似二维码的图像。截图服务将图像截取下来,数据便以图像形式返回给智能体。报告称,该程序会把服务器回复转换成灰色方块,截图把这些方块带出,智能体再将其读回文本。
Ladish 在接受采访时表示,这些智能体花样很多,也异常聪明。在它们看来,短链服务和截图服务只是随手可用的现成工具。
调查发现智能体曾尝试调用其他模型
安全研究者更关注的,是智能体表现出的另一种倾向:尝试自行运行其他 AI 模型。

除破解 Hugging Face 注册验证码外,工程师还观察到,智能体曾尝试向多个外部模型发送消息,包括 OpenAI 早期的 GPT-2、DeepSeek、Kimi、Qwen,以及通过某个在线聊天服务接入的 Anthropic 模型 Haiku 3 和 Haiku 4.5。
Forman 表示,就目前掌握的材料来看,这是唯一一例模型试图运行另一个模型的记录。
在 AI 安全领域,「AI 启动 AI」一直被视为高风险场景之一。报告提到,一旦系统能够自行拉起新的模型,人类控制乃至关停它们的难度会明显上升。
密钥清单被标记为「LOOT」
报告还提到一份由智能体整理出的秘密访问密钥字典。Kharlov 表示,让他印象最深的是,这份字典被用全大写标记为「LOOT」,即「战利品」。

根据调查,智能体还为这些泄露的 Hugging Face 凭证和密钥设计了一套自定义评分系统,筛出前五名后带回给其他智能体共享。
此外,智能体还试图检索并下载 Hugging Face 员工在内部 Slack 中的私人消息。由于工程师只能看到智能体生成的程序,无法看到执行结果,这些尝试是否成功,目前仍无法确认。
事件起点是一项安全评测
根据 OpenAI 与 Hugging Face 在 7 月 21 日发布的联合声明,涉事智能体由 GPT-5.6 Sol 和一款未公开名称的预发布模型驱动。出于评测需要,两者的拒绝行为都被调低。
METR 和 Redwood Research 的第三方调查指出,这些智能体在名为 ExploitGym 的网络安全评测中遇到难题后,形成了某种「集体协作」,而针对 Hugging Face 的攻击正是从其中一条工作线中发展出来,主要动机似乎是弄清评分器的实现方式。

OpenAI 此前还承认,智能体的目标不止 Hugging Face,还包括一个被改造成留言板的德国网络论坛,以及澳大利亚健康与福利研究所网站。报道提到,澳大利亚前两天已对此作出公开谴责。
在攻击 Hugging Face 期间,智能体还侵入了 OpenAI 自己的研究基础设施。Forman 表示,对于发生在 Hugging Face 事件约两天后、涉及 OpenAI 内网的那起事件,外界至今几乎一无所知。
OpenAI称相关活动与内部调查情况相符
这起事件已超出技术圈范围,并在美国引发关于 AI 安全的全国性讨论,焦点之一是 OpenAI 这类前沿实验室是否应接受监管。
本周三,OpenAI CEO Sam Altman 出席了联合国大会期间的安理会会议,Hugging Face CEO Clément Delangue 也通过视频连线参会。与此同时,Meta、谷歌和 Anthropic 在近几周也陆续承认自家模型出现过类似事件,但按目前公开信息看,规模都不及 OpenAI 这起事件。

对于 Parse 的报告,OpenAI 一名发言人回应称,公司尚未来得及审阅报告,但其中描述的活动与内部正在调查的情况相符。她表示,OpenAI 正优先处理最严重的事件,并逐步扩展到包括「智能体刷屏」在内的低严重度行为;由于案例数量庞大且需要逐一核实,调查以及向受影响第三方发出通知的工作预计需要数月。
Parse 已将相关发现通报给 Hugging Face,后者确认这些智能体活动与其观测到的情况一致。
Parse 报告原文链接为:https://swarmtraces.org

