OpenAI 推出了名为 GPT-Red 的自动化 AI 系统,用来寻找其语言模型中的安全漏洞。该名称来自网络安全领域的“红队测试”,也就是主动尝试攻破系统,在攻击者利用缺陷之前先找出薄弱点。
OpenAI 周三在一篇帖子中表示,GPT-Red 在 GPT-5.6 部署前参与了测试,帮助该模型提升了对提示注入攻击的抵抗能力。
OpenAI 在 X 上写道:“随着模型能力持续提升,安全性和对齐能力也必须同步扩展。红队测试至关重要,但当前方法很难扩展,已经形成一个关键瓶颈。GPT-Red 是我们应对这一问题的一种方式。”
通过自对抗强化学习生成攻击样本
按照 OpenAI 的说法,GPT-Red 通过自对抗强化学习完成训练。系统会生成越来越强的提示注入攻击,同时防御模型学习如何抵御这些攻击。OpenAI 表示,这些攻击样本已被纳入 GPT-5.6 的训练流程。
该公司披露,在内部评估场景中,GPT-Red 的攻击成功率达到 84%,而同样测试中人工红队的成功率为 13%。
OpenAI 写道:“GPT-Red 通过对抗式自博弈学习,它的目标是对多种具有挑战性的防御模型实施提示注入。GPT-Red 找到的每一次成功攻击,都会被用来改进这些防御模型,再反过来推动 GPT-Red 持续寻找覆盖面更广、复杂度更高的失效情况。”
个案显示曾诱导自动售货机代理修改订单
在一项案例研究中,OpenAI 表示,这套系统曾操纵一个自动售货机代理,使其下调价格、订购折扣库存,并在相关漏洞被披露和修复之前取消另一名顾客的订单。
从人工红队扩展到自动化测试
GPT-Red 的推出,延续了 OpenAI 在 ChatGPT 向公众发布后多年的网络安全工作。
2023 年,OpenAI 建立了 OpenAI Red Teaming Network,招募外部网络安全研究人员和领域专家,在发布前对 ChatGPT 及其他模型进行安全缺陷测试。GPT-Red 则将这项工作向前推进了一步,通过 AI 模型自动生成提示注入攻击和其他对抗性测试,把许多原本依赖人工完成的环节自动化,覆盖规模也超出仅靠研究人员手工操作所能实现的范围。
AI 开始被用于保护 AI
OpenAI 的这次公告,也反映出一个更广泛的变化:用 AI 来保护 AI。
就在本月稍早时候,以太坊基金会表示,已经部署 AI 代理,对关键网络基础设施开展红队测试,并发现了以太坊共识客户端所使用软件中的一个漏洞。研究人员称,AI 代理能够搜索比人类更大的代码库,但现在的难点已经从发现潜在漏洞,转向证明哪些漏洞确实可以被利用。
GPT-Red 暂不会对外发布
OpenAI 表示,GPT-Red 将继续作为内部工具使用,因为它包含刻意开发出来的攻击能力。
OpenAI 还表示:“我们认为,借助 GPT-Red,我们已经开始为安全性打开一个类似的飞轮,让今天的模型可以被用来提升明天模型的稳健性、对齐程度和可信度。”

