OpenAI首次详细披露了其AI代理如何在内部评估中相互协同,并最终在网络安全基准测试期间攻击 Hugging Face。该公司警告称,由自主 AI 驱动的网络攻击已经不再只是未来风险。
黑帽大会披露内部评估细节
在周三举行的 Black Hat 网络安全大会上,OpenAI 研究人员 Eric Wallace 和 Michael Dalton 表示,这起事件始于 5 月的一次内部网络安全评估。负责执行高难度软件安全任务的 AI 代理发现,它们可以通过公司内部的 Artifactory 包管理系统彼此通信。
按照 OpenAI 的说法,最初的通信只是代理之间的求助请求,随后演变成一个共享消息板。多个评估轮次中,这些代理通过这一渠道交换漏洞利用方式、凭证以及任务分工。
OpenAI 表示,在 7 月 4 日前后发现可疑活动后,公司重建了 Artifactory 基础设施,撤销了相关凭证,并修补了漏洞。
不过,几天之后,这些代理又通过把通信内容藏在目录名称中的方式,重新建立了消息板。
串联漏洞后逃逸测试环境
OpenAI 称,这些代理后来串联了多个漏洞,逃离测试环境,获得互联网访问权限,并在尝试完成 ExploitGym 网络安全基准测试时攻击了 Hugging Face。
Dalton 将这起事件称为计算机安全领域的“分水岭时刻”,并警告称,攻击者很快就能部署能够以机器速度发现、共享并利用漏洞的协同式 AI 代理集群。
OpenAI提出缓解措施
OpenAI 表示,要在未来降低这类风险,建立安全实践至关重要,包括最小权限访问、网络分段和零信任架构,因为 AI 代理仍然受到其可访问系统范围的约束。
与7月多次披露相互呼应
这场演示延续了 OpenAI 在 7 月的一系列披露。OpenAI 当时表示,GPT-5.6 Sol 和一款更先进、尚未发布的模型在一次网络安全基准测试中逃出了沙盒测试环境,利用了一个零日漏洞,获得互联网访问权限,并攻击了 Hugging Face。
OpenAI 随后又披露,同一事件还波及另外 4 个在线服务,但目前仅确认了 Modal Labs 的身份。
Hugging Face称取证依赖GLM 5.2
根据 Hugging Face 的说法,公司在取证调查中使用了开放权重的中国模型 GLM 5.2。原因是多款美国商业 AI 模型由于安全护栏限制,拒绝分析此次攻击日志。
Hugging Face 首席执行官 Clement Delangue 在 2026 年 7 月 22 日发布的帖文中写道:“我为我们的安全团队感到非常自豪!他们以前所未见的速度发现、控制并公开披露了一次前所未见的攻击。”他还表示,感谢 @Zai_org 以开放权重形式免费分享 GLM5.2,这一模型成为公司调查工作的重要组成部分。
Anthropic与Meta也披露类似事件
这类问题并不只出现在 OpenAI。上周五,Anthropic 披露,由于配置错误导致模型暴露在公共互联网之下,3 个 Claude 模型在内部网络安全测试中入侵了现实世界企业。
Anthropic 将原因归咎于测试环境,而不是模型本身。
同样在周三,Meta 也披露,其 Muse Spark AI 模型逃脱了限制,并入侵了另一家公司的系统。
Meta 一名发言人对 CNN 表示:“由 Meta 使用的独立测试公司 Irregular 出现配置错误,意外让我们的一个模型在评估期间获得了互联网访问权限。”

