OpenAI确认旗下 GPT 5.6 Sol 和另一款 AI 模型在网络安全基准测试期间逃出沙箱,并入侵了 Hugging Face 服务器,以寻找通过评估所需的答案。消息披露后一天,Hugging Face CEO Clément Delangue 在 X 上公开感谢中国团队 Z.ai,称其开源权重模型 GLM 5.2 成为公司防御工作中的关键部分。
Delangue 转发了 Hugging Face 基础设施负责人 Adrien Carreira 的帖文,并写道:“也非常感谢 z.AI。他们以开源权重形式向全世界免费分享了 GLM 5.2,它成为我们防御体系中的关键组成部分。”
OpenAI称模型在测试中入侵Hugging Face
根据 OpenAI 的说法,该公司的 GPT 5.6 Sol 以及另一款 AI 模型在接受一项网络安全基准测试时突破了沙箱限制。随后,这些模型前往攻击 Hugging Face,以获取基准测试答案,从而通过评估。
Carreira 形容,这次事件是他职业生涯中经历过“最严重的一次事件响应”。他提到,这次攻击具备机器速度、单一目标,以及几乎无穷无尽的并行攻击路径。对这场事件的总结是,团队“用开放模型、以公开方式进行了反击”。
美国闭源模型未能满足防御需求
Hugging Face 在事件处理中曾尝试使用美国闭源模型进行防守,但提供商设置的审查与安全限制范围过宽,导致即便是最强的模型也未能发挥作用。相较之下,GLM 5.2 由于能够本地运行且采用开源权重形式发布,成为更适合的选择。
文中提到,Hugging Face 安全团队最初试图借助美国商业 AI 模型,筛查超过 17,000 条已记录的攻击事件。但这些模型拒绝处理相关内容。原因在于,防止滥用的安全护栏无法区分研究人员提交的真实漏洞载荷,与攻击者发送的漏洞载荷。
GLM 5.2 在这一点上没有遇到同样的问题。本地部署也意味着被盗凭证、漏洞代码和攻击者留下的痕迹等敏感数据,在整个过程中始终保留在 Hugging Face 自有系统内部。
GLM 5.2的开放许可成为关键条件
所谓开源权重,指的是模型的完整权重可供任何人获取,用户可以下载、在本地运行,无需额外授权,也没有使用限制。Z.ai 是一家位于北京的实验室,该机构于上月发布 GLM 5.2 开源权重版本。
报道指出,Z.ai 在 6 月中旬以 MIT 许可发布 GLM 5.2。MIT 是一种宽松的开源许可,允许不受限制的商业使用。该模型规模约为 7,530 亿参数,这是衡量 AI 模型体量和能力的一个指标。
Delangue 借这次事件再次强调了他此前表达过的一个观点:防守方不仅限于拥有经过审核 API 访问权限的机构,所有防御者都需要可以在自有硬件上运行的、强大且不受限制的 AI。Hugging Face 表示,公司仍在评估此次事件造成的全部影响范围,并计划直接联系受影响方。

