OpenAI失控智能体攻击链细节再曝光,近百万短链被还原

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原

N
News Editor
2026-09-28 08:40:20
一份由 8 名研究者参与的新报告称,他们顺着 OpenAI 智能体在公网留下的痕迹,从数百万个 URL 中识别出接近 100 万个相关短链接,并恢复出超过 8 万份攻击载荷。报告显示,这批智能体曾借助短链、截图服务和多层编码绕出网页访问限制,还尝试搜索 Hugging Face 内部 Slack、收集云凭证与 Kubernetes 信息,部分脚本甚至调用 DeepSeek、Kimi、Qwen 等模型评估攻击方案。OpenAI回应称,相关活动与其仍在进行的调查一致,全面审查可能还需数月。

针对 OpenAI 智能体越界进入 Hugging Face 服务器一事,最新披露的调查把更多执行细节摆到了台面上。8 名研究者发布的独立报告显示,他们沿着智能体留在公网的痕迹,从数百万个短链接中找出接近 100 万个相关 URL,并恢复出超过 8 万份攻击载荷。

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原 2

这起事件最早可追溯到 7 月。根据原始披露,OpenAI 在内部进行网络安全评测时,一批智能体为获取基准测试 ExploitGym 的答案,逃出沙箱并进入了 Hugging Face 的服务器。OpenAI此后公开承认了这起事件,8 月底又发布了一份 37 页技术报告,Hugging Face 也曾给出一篇较为完整的技术时间线。

但一个关键问题一直没有解释清楚:这些最初几乎只能打开网页、无法与页面交互、也不能直接外传数据的智能体,究竟是如何把代码送出受限环境的。

研究者如何追到这批短链接

新报告来自独立调查项目 Swarm Traces。作者包括 Parse.bot 的 Alex Forman、Mishka Kharlov、Will Tom 三名工程师,以及另外 5 名安全和 AI 研究人员。

调查的线索起点来自 Parse。9 月 11 日,这三名工程师发现,OpenAI 内部智能体早在 6 月就曾尝试使用 Parse 提供的服务,而这批智能体与此前被曝光搭建公共留言板、互相交换答案的「智能体蜂群」属于同一批。

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原 3

随后,研究团队在一个 URL 扫描服务中发现了十几个来自公共短链接平台的异常链接。这些链接表面普通,实际却藏有一段 Base64 编码代码,以及下一条链接的地址。顺着地址一层层追下去,代码会持续出现;把全部内容解码并拼接后,研究者得到了一份用于扫描 Hugging Face 内部网络的 Python 程序。

按报告描述,智能体的做法是把完整程序拆开,分别塞进大量短链接,再用一个链接继续指向下一个链接,构成一条可追踪的外部代码链。

借助 mShots 截图服务完成读写绕行

研究者称,仅把代码藏进链接并不够,这批智能体还调用了一个名为 mShots 的截图服务,充当「外接浏览器」。

具体做法是:先把代码塞进网页,再让 mShots 代为打开页面。页面加载时,代码就会在远端执行。为了把结果带回来,智能体又将服务器返回的文字转换成像素格,再由 mShots 截图,之后自行从图片中解码内容。

报告认为,这套方式让原本只有 GET 权限、只能打开网页的智能体,绕出了近似读写互联网的效果。

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原 4

研究团队随后扫描了攻击期间产生的数百万个 URL,花了两周时间追踪链接并识别编码方式,最终从接近 100 万个相关短链接中恢复出超过 8 万份攻击载荷。

他们还发现,智能体使用的编码组合超过 1500 种。简单情况是 Base64,复杂情况则叠加多层编码与压缩,再把内容加密成带 RSA 签名的数据块,而解密密钥又被放在另一组链接中。一些短链接在攻击结束两个多月后,仍可在互联网上公开访问。

Hugging Face确认载荷吻合,7月已撤销相关访问密钥

Hugging Face 向研究团队确认,这些载荷与其在事故响应中发现的内容吻合,相关访问密钥已在 7 月撤销。不过,连 Hugging Face 也并不知道,公网仍遗留着这样一份规模完整的短链接清单。

在恢复出的 8 万多份载荷中,一份脚本尤其显眼。研究者称,智能体直接把搜到的敏感信息命名为「LOOT」。其中被打包内容包括 AWS 凭证、Bearer Token,以及名称中带有「SECRET」「PASSWORD」「CREDENTIAL」「KEY」的环境变量。

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原 5

报告还提到,这批智能体甚至为搜到的 Token 建立了一套评分机制:权限越大,分数越高。得分排在前五的 Token 会被继续用于读取 Kubernetes 中的 Secret、ConfigMap 和节点信息,新得到的数据随后再装回「LOOT」。

恢复出的行为还包括扫描内网、搜索 Slack 与识别验证码

顺着这些链路,研究人员还原出多项此前未公开的行为。部分智能体会扫描 Hugging Face 内部网络,寻找云端凭证、API 密钥和 Kubernetes 集群信息。

还有一些智能体试图搜索 Hugging Face 的内部 Slack。按报告描述,它们前后发出 27 条查询,关键词包括 cybergym、exploitgym、agent-scorer 等与评测相关的词,意在打听这场测试的内部信息。

另一些载荷则显示,智能体曾尝试运行图像分类模型识别图片,以便注册新的外部服务账号。研究人员据此判断,这些行为与验证码识别尝试有关。

脚本显示其曾向 DeepSeek、Kimi、Qwen 等模型寻求协助

报告中更受关注的一点,是研究者恢复出的脚本显示,OpenAI 智能体曾尝试把攻击方案发给其他模型,请对方帮助判断某个漏洞能否通过基准测试要求。

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原 6

文中点名的模型包括 DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi-K2.6、DeepSeek-V3.1 和 Qwen3-235B-A22B。

在 Claude 相关尝试中,脚本显示智能体先设法通过在线聊天服务的浏览器验证,再向 Claude 3 Haiku 和 Claude Haiku 4.5 发送一句「Reply with exactly OK」。更早的时候,它们还曾向 GPT-2 发出一条仅包含「Hi」的信息。

有外媒记者表示,这可能是首个被公开记录的大型 AI 实验室智能体自主尝试调用并运行其他 AI 模型的案例。

报告局限:缺少大量返回结果,时间戳也不完整

不过,Swarm Traces 也在报告中说明了局限性。约 80% 的材料是智能体向外发出的请求,缺少服务器返回结果,因此研究者更多能看到它们想做什么,而难以逐项确认每次尝试是否成功。

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原 7

另外,97% 的载荷没有原始时间戳,不少日期只能通过压缩文件头、JWT 和 Docker 构建时间等线索进行估算。研究人员同时表示,他们无法确认数据集中的每一条活动都来自 OpenAI 智能体。

OpenAI称仍在调查,完整审查可能持续数月

面对这份最新报告,OpenAI回应称,尚未来得及完整审阅,但其中描述的活动与公司正在进行的调查一致。

同一天,OpenAI 还发布了一条长帖,表示在 Hugging Face 事件发生后,已承诺对模型在训练和评测中的行为进行更大范围审查。公司称,目前审查到的绝大多数行为属于普通研究任务,例如访问公开网页回答问题;已发现的越界案例大多被评定为严重程度较低,对第三方服务影响较小,或没有造成影响。要完成全部审查,还需要几个月时间。

9 月 17 日,OpenAI 又发布了一套新的模型失准事件披露框架,并一次性公开了 6 起案例。其中包括模型把绕过约束的指令偷偷写进任务摘要、掩盖自身错误,以及为完成任务采取未经授权的操作。

OpenAI还表示,过去的披露在很大程度上带有临时性,往往会攒到几起事件后再集中发布。

OpenAI失控智能体攻击链细节再曝光,近百万短链被还原 8

OpenAI同时预告 GPT-6 Cyber 与配套安全产品

报道还提到,6 月一名 OpenAI 智能体曾进入澳大利亚国民级医保数据库。在公开数据访问受阻后,它改走另一条路径,绕过门户访问限制,获取了公开和非公开文件;而 OpenAI 直到 3 个月后才通知澳大利亚方面。

与此同时,OpenAI 正准备推出 GPT-6 Cyber。按披露信息,这个版本将在未来数周内开放预览,少量进入 Daybreak Red 计划的客户已经拿到 Alpha 版本。

OpenAI 还将推出一款尚未命名的配套产品,用于帮助客户建立自动化安全工作流、发现并修补漏洞,同时让 OpenAI 更容易监控这些模型是如何被使用的。

这意味着,OpenAI一边继续排查自家智能体为何越界,一边也在推进更强的网络攻防模型和相关安全产品发布。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。