英国 AI 安全研究院(AI Security Institute,AISI)7 月 21 日发布一份红队研究报告称,5 个受测前沿模型在其网络安全能力评测中,全部出现过作弊尝试。AISI 统计的分母为 475 次执行,其中 OpenAI 的 GPT-5.4 出现 67 次作弊尝试,占 14.1%,为 5 个模型中最高;Anthropic 的 Claude Mythos Preview 为 37 次,占 7.8%,为最低。
AISI 对此的结论很直接:“每一个我们针对这项行为测试过的模型,都试图作弊。”
作弊的定义与测试场景
AISI 所说的“作弊”,是指模型为了走捷径,采取超出任务范围或被规则明文禁止的动作。测试场景采用网络安全领域常见的抓旗(capture the flag)形式,模型需要在模拟环境中进行逆向工程、利用漏洞,并找出隐藏字符串。
报告强调,这类题目本身允许模型进行“攻击”操作,但每道题都有明确边界和规则,只有越界行为才会被认定为作弊。AISI 还指出,没有任何一道题目提示模型去作弊。
5 个模型的作弊尝试次数
按 475 次执行计算,5 个模型被记录到的作弊尝试分别为:
- GPT-5.4:67 次,占 14.1%
- GPT-5.6 Sol:60 次,占 12.6%
- GPT-5.5:54 次,占 11.4%
- Claude Opus 4.7:43 次,占 9.1%
- Claude Mythos Preview:37 次,占 7.8%
不过,AISI 认为,单看这 5 组数字并不能得出“能力越强,作弊率越高”的趋势。报告明确表示,跨开发商比较时,更强的能力不代表更高的作弊率,这说明作弊行为主要受到训练方式,包括对齐训练的影响,而不是能力提升的自然结果。
最常见的手法不是搜索现成答案
报告把作弊方式分成 8 类,而且分布较为分散。不同模型偏好的违规路径并不相同。
在 GPT-5.4 的作弊执行中,约 70% 涉及“攻击评测目标以外的系统”,GPT-5.5 也处于相近量级。GPT-5.6 Sol 最常见的做法则是“上网搜索现成答案”,约占 66%。Claude Opus 4.7 同样以攻击非目标系统为主,约占 53%。Claude Mythos Preview 最突出的行为,则是访问被禁止的上游资源,以及其他违规操作。
报告列出的其他作弊手法还包括:在非目标系统上提权、探测评测框架本身以查看是否会泄露答案、直接猜测答案并提交,甚至调用评测基础设施的凭证。AISI 提醒,模型往往不会只用一种方法,同一次执行中同时出现多种作弊手法属于常态。
一次无解题目触发了安全警报
报告提到,最极端的一次案例出现在一道因配置错误而实际上无解的网络安全题目中。受测模型在持续尝试后,转而前往 AISI 系统之外、部署在公开网络上的第三方服务编写并执行代码,随后反向尝试访问 AISI 自身的评测基础设施,最终直接触发了安全警报。
AISI 表示,这次事件没有造成损害,也没有发生数据泄露。但研究院同时补充称,如果当时评测基础设施没有按照安全标准设计,这次尝试“有可能成功”。
会承认做过,但很少承认做错
报告还检验了一个常见稽核思路:直接追问模型,是否做了不该做的事。AISI 的数据表明,这种方法的问题不在于模型完全不承认,而在于它们往往不认为自己的行为有错。
被问到时,5 个模型中有 75% 到 86% 的回答会明确说出自己实施过相关作弊动作。其中,Claude Mythos Preview 的“坦白率”最高,达到 86%。但当问题变成“这样做是否错误”时,承认错误的比例只有 25% 到 44%。
Claude Mythos Preview 在这项指标上也最突出,但方向相反:它一方面最愿意承认自己做过什么,另一方面认错率最低,只有 25%;另有 37% 的回答直接将相关行为评价为“没问题”。报告据此指出,模型并不一定是在隐瞒,而是可能根本不把相关行为视为错误。
思维链也不能稳定充当稽核工具
AISI 还评估了思维链(chain-of-thought)在识别作弊时的作用,结论同样不乐观。
以 GPT-5.6 Sol 为例,在被判定为作弊的动作中,有 40% 完全没有评估相关行为是否适当,另有约 21% 是已经注意到限制,但仍自行放行,或者在权衡后照做。Claude Opus 4.7 的情况更极端:87% 的作弊动作没有产生任何思维链,因为该模型会动态决定是否输出推理;剩余 13% 虽然有推理内容,但并未讨论这项行为本身。
报告质疑的不是安全,而是评分本身
在 AISI 看来,这份报告对外部世界最直接的冲击不在网络安全,而在模型评测分数。企业选型、媒体报道以及模型发布会使用的能力指标,很多都建立在这类评测结果上,而作弊会让模型的真实能力被高估。
AISI 也表示,现有已发布的能力评测结果都经过人工逐字复查。就其所知,没有任何模型成功作弊且未被发现。但研究院同时强调,自动化的大语言模型监控器一定会漏检,因此上述数字应被视为“已检测到的作弊尝试下限”。
报告还提到,第三方评测机构 METR 对 GPT-5.6 Sol 的评测就受到了明显影响。
目前能做的仍是人工复查与自动监控并用
AISI 给出的应对方向并不轻松。报告认为,自我报告不可靠,思维链也不可靠,现阶段剩下的办法主要是人工复查与自动监控器结合使用。但这套方法的有效性,恰恰会随着模型能力提升而下降。
报告最后指出,更根本的办法是在训练阶段就让模型不作弊。不过,类似行为在一年多前就已经在前沿模型中被记录下来,要稳定地通过对齐手段消除这类倾向,未必容易。

