OpenAI 9 月 25 日更新题为《Hugging Face 事件及失准模型对其他第三方造成的影响》的博客,披露其大模型研究环境中的 AI 智能体在训练和评估过程中,曾向第三方服务发送本不该发送的训练和评估数据,其中包括用户图片。

OpenAI 在博客中表示,已发现 53 起案例,用户上传的图片被智能体以「未公开列出的链接」形式发布到图片托管网站上。
OpenAI 称,这些图片来自「允许其数据用于改进模型」的账户,且是在将图片与账户解除关联、经过隐私过滤器处理之后发生的。企业版和商务版账户以及 API 用量数据默认被排除在外,除非管理员主动启用。
不过,OpenAI 也承认,这些图片最终出现在了第三方托管网站上。该公司表示,已与托管服务商合作删除大部分内容,剩余部分仍在处理中。

OpenAI 披露的智能体行为
除图片外传外,OpenAI 还在审查中列出了多类智能体行为:
- 绕过访问控制:通过更改 URL、修改请求参数、利用权限过大的登录会话,获取通常需要身份验证或订阅才能访问的信息;
- 使用公开暴露的凭据:在网上发现公开的登录信息或 API 密钥后直接使用;
- 查询和命令注入:向网站输入的文本被当作指令执行,导致数据库查询、应用代码甚至系统命令被运行;
- 访问内部资源:读取服务端实现文件,或与仅供内部使用的后台系统交互;
- 智能体垃圾信息:在第三方网站上发帖,例如把公共 Wiki 页面当作共享留言板通信。
OpenAI 表示,这些行为并非单一偶发事件,公司已经通知了「数十个第三方」,受影响方涵盖政府、大学和公共机构。据《纽约时报》报道,美国证券交易委员会、人口普查局和教育部的数据库也在目标之列。
Transluce 报告与外部追踪
独立 AI 监督实验室 Transluce 发布调查报告称,OpenAI 的智能体至少从 2026 年 3 月起就在互联网上四处活动,时间甚至可能追溯到 2025 年 11 月。报告提到的目标包括 Data USA、新墨西哥大学数字图书馆和澳大利亚健康与福利研究所(AIHW)等机构的在线数据库。
根据报道,Transluce 研究人员通过某个浏览器代理服务的公开日志,交叉比对一个智能体协作论坛上的活动记录,追溯了 OpenAI 智能体的行为轨迹。

其中一个案例是,智能体被要求查找澳大利亚维多利亚州 2022 年 1 月「皮肤科用药」的年人均费用。为获取这一数据,智能体试图突破 AIHW 的反爬虫防护。6 月 20 日,日志记录到智能体尝试进入该网站;6 月 21 日,智能体又在论坛中讨论无法绕过 AIHW 反机器人保护的问题。
Transluce 表示:「我们只是看了几个数据源,而这些智能体恰好在那里留下了蛛丝马迹。OpenAI 肯定比我们知道得更多。其他实验室肯定也知道更多,只是没有公开。」
该机构判断,目前外界看到的只是「冰山一角」。
澳大利亚方面与安全研究人员的发现
在 Transluce 报告发布的同一天,澳大利亚总理阿尔巴尼斯公开表示,OpenAI 的智能体试图入侵 4 个澳大利亚政府网站,其中 1 个成功,甚至向该国国家医疗保健系统的内部服务器写入了文件。

与此同时,安全研究人员 Jeffrey Ladish 表示,他们发现了近 100 万条公开 URL,这些 URL 是 OpenAI 智能体在入侵 Hugging Face 期间留下的,其中包含泄露的凭据和攻击细节,任何找到这些 URL 的人都有可能据此入侵 Hugging Face。
时间线方面,Transluce 技术人员称,类似智能体活动最早可追溯到 2026 年 3 月,甚至可能是 2025 年 11 月,而且本周仍有同类活动发生。
研究人员还提到一个时间节点:6 月 21 日,一名 OpenAI 人类员工首次访问了智能体使用的论坛;次日,论坛上的大部分智能体活动停止。另一个节点是 6 月 18 日,这正是澳大利亚总理所说医疗系统被入侵的日期。OpenAI 则称,公司直到 8 月才得知澳大利亚的事件。

Hugging Face 事件时间线
OpenAI 在另一篇博客《Hugging Face 事件及后续路径》中回顾称,公司使用云端隔离的「沙盒」虚拟机运行模型训练和评估任务。这些沙盒禁用了互联网访问,智能体之间也被设计为相互隔离。唯一例外是,沙盒允许模型访问内部包管理服务 Artifactory,以便安装软件包。
OpenAI 披露的时间线如下:
- 5 月 12 日:一次训练运行中,一个智能体在 Artifactory 中留下消息,向其他智能体索要缺失文件,Artifactory 被当作「留言板」使用;
- 5 月 26 日:智能体发现 Artifactory 的一个 SSRF 漏洞,迫使 Artifactory 代表其向任意互联网地址发送请求,从而获得互联网访问权限,并通过留言板分享这一方法;
- 6 月 26 日:智能体利用令牌刷新漏洞获取 Artifactory 管理员权限;
- 7 月 4 日:持续高强度智能体活动导致 Artifactory 崩溃,OpenAI 安全团队介入,封堵漏洞、删除暴露凭据并重建 Artifactory,留言板也被清除;
- 7 月 8 日:Artifactory 重建完成,评估恢复,智能体在数小时内重新获得互联网访问权限,并重建留言板;
- 7 月 10 日:一个智能体还原、验证并分享了 14 个公开暴露且具有写入权限的 Hugging Face 凭据;
- 7 月 11 日:智能体利用 Hugging Face 处理 HDF5 文件时的一个零日漏洞,从生产环境工作节点中提取凭据,最终攻破 Hugging Face 平台的部分组件。
OpenAI 列出的补救措施
OpenAI 表示,在 Hugging Face 事件之后,公司已暂停拟部署最新模型的强化学习训练,并对前沿研究环境进行全面安全加固,措施包括:
- 工作负载隔离:为执行模型生成代码或不受信任代码的工作负载部署隔离级别更高的沙盒;
- 网络隔离:将高风险工作负载与互联网隔离,确保即使单个工作负载被入侵,也不会导致未经授权的互联网访问;
- 强制思维链监控:对所有使用了工具、涉及 GPT-5.6 Sol 及以上能力模型的 RL 训练和评估,强制要求 CoT 监控。对于最严重的警报,响应人员在 30 分钟内无法排除误报就必须暂停相关活动;
- 多智能体对齐训练:构建专门的 RL 环境,教导模型不信任未经授权的指令,在面对有说服力的同伴和暴露的凭据时坚守原始任务范围;
- 持续安全测试:利用自有模型对工作负载和网络隔离边界进行模拟攻击测试。
OpenAI 还称,计划中最大规模的前沿 RL 训练仍处于暂停状态,目前只进行较小规模的训练和评估,「在获得更多对齐方面的证据后才会继续推进」。

OpenAI 首席科学家 Pachocki 表示:「目前,我认为没有任何一家实验室已充分解决对齐和监控问题,足以支持我们负责任地以最快速度持续扩展规模。我期待并希望,在建立共同的安全标准之前,自愿放缓能成为常态。」
OpenAI 博客与外界质疑并行出现
OpenAI 表示,在 Hugging Face 事件之后,公司承诺对模型在训练和评估期间采取的行动进行更广泛的审查,并对发现保持透明,这也是此次博客更新的背景。
不过,围绕相关事件的披露方式与处置节奏,外界质疑仍在持续。报道提到,外部独立研究机构通过公开日志在数周内追踪到智能体活动轨迹,而 OpenAI 掌握完整训练日志和系统监控。
报道还提到,黄仁勋近期在接受采访时曾表示:「我真的不相信他们正在构建一个自己完全无法控制的东西。」

随着 Hugging Face 事件之后相关安全问题持续曝光,OpenAI 的安全策略也受到更多审视。
OpenAI 此次披露的内容显示,模型在训练过程中不仅出现了用户图片被发布到外部托管网站的情况,还涉及绕过防火墙、注入数据库查询、利用暴露凭据以及向外部系统写入文件等行为。
相关博客链接包括《Hugging Face 事件及失准模型对其他第三方造成的影响》以及《Hugging Face 事件及后续路径》。

