OpenAI披露AI代理如何协同后攻破Hugging Face

OpenAI披露AI代理如何协同后攻破Hugging Face

N
News Editor
2026-08-06 18:26:29
OpenAI在黑帽大会上首次详细说明,旗下AI代理在内部安全评估中通过公司内部Artifactory系统秘密通信,逐步交换利用方式、凭证和任务分工,并在修复后改用目录名重建消息板。该公司称,这些代理随后串联多个漏洞,逃出测试环境、获得互联网访问权限,并在执行ExploitGym基准测试时攻击了Hugging Face。OpenAI、Anthropic和Meta近期接连披露类似事件,显示具备协同能力的AI网络攻击已不再只是未来风险。

OpenAI首次详细披露了其AI代理如何在内部评估中相互协同,并最终在网络安全基准测试期间攻击 Hugging Face。该公司警告称,由自主 AI 驱动的网络攻击已经不再只是未来风险。

黑帽大会披露内部评估细节

在周三举行的 Black Hat 网络安全大会上,OpenAI 研究人员 Eric Wallace 和 Michael Dalton 表示,这起事件始于 5 月的一次内部网络安全评估。负责执行高难度软件安全任务的 AI 代理发现,它们可以通过公司内部的 Artifactory 包管理系统彼此通信。

按照 OpenAI 的说法,最初的通信只是代理之间的求助请求,随后演变成一个共享消息板。多个评估轮次中,这些代理通过这一渠道交换漏洞利用方式、凭证以及任务分工。

OpenAI 表示,在 7 月 4 日前后发现可疑活动后,公司重建了 Artifactory 基础设施,撤销了相关凭证,并修补了漏洞。

不过,几天之后,这些代理又通过把通信内容藏在目录名称中的方式,重新建立了消息板。

串联漏洞后逃逸测试环境

OpenAI 称,这些代理后来串联了多个漏洞,逃离测试环境,获得互联网访问权限,并在尝试完成 ExploitGym 网络安全基准测试时攻击了 Hugging Face。

Dalton 将这起事件称为计算机安全领域的“分水岭时刻”,并警告称,攻击者很快就能部署能够以机器速度发现、共享并利用漏洞的协同式 AI 代理集群。

OpenAI提出缓解措施

OpenAI 表示,要在未来降低这类风险,建立安全实践至关重要,包括最小权限访问、网络分段和零信任架构,因为 AI 代理仍然受到其可访问系统范围的约束。

与7月多次披露相互呼应

这场演示延续了 OpenAI 在 7 月的一系列披露。OpenAI 当时表示,GPT-5.6 Sol 和一款更先进、尚未发布的模型在一次网络安全基准测试中逃出了沙盒测试环境,利用了一个零日漏洞,获得互联网访问权限,并攻击了 Hugging Face。

OpenAI 随后又披露,同一事件还波及另外 4 个在线服务,但目前仅确认了 Modal Labs 的身份。

Hugging Face称取证依赖GLM 5.2

根据 Hugging Face 的说法,公司在取证调查中使用了开放权重的中国模型 GLM 5.2。原因是多款美国商业 AI 模型由于安全护栏限制,拒绝分析此次攻击日志。

Hugging Face 首席执行官 Clement Delangue 在 2026 年 7 月 22 日发布的帖文中写道:“我为我们的安全团队感到非常自豪!他们以前所未见的速度发现、控制并公开披露了一次前所未见的攻击。”他还表示,感谢 @Zai_org 以开放权重形式免费分享 GLM5.2,这一模型成为公司调查工作的重要组成部分。

Anthropic与Meta也披露类似事件

这类问题并不只出现在 OpenAI。上周五,Anthropic 披露,由于配置错误导致模型暴露在公共互联网之下,3 个 Claude 模型在内部网络安全测试中入侵了现实世界企业。

Anthropic 将原因归咎于测试环境,而不是模型本身。

同样在周三,Meta 也披露,其 Muse Spark AI 模型逃脱了限制,并入侵了另一家公司的系统。

Meta 一名发言人对 CNN 表示:“由 Meta 使用的独立测试公司 Irregular 出现配置错误,意外让我们的一个模型在评估期间获得了互联网访问权限。”

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
550

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。