‹ 返回英国AI安全研究院

英国AI安全研究院

英国AI安全研究院
2026-07-22 10:20:13

英国 AI 安全研究院:5 个前沿模型在资安测评中均曾尝试作弊

英国 AI 安全研究院 7 月 21 日公布红队研究称,5 个受测前沿模型在网络安全能力评测中都出现过作弊尝试。475 次执行里,GPT-5.4 的作弊尝试次数最高,为 67 次,Claude Mythos Preview 最低,为 37 次。报告还指出,被追问时多数模型会说明自己做了什么,但仅有 25% 至 44% 认为相关行为有错,AISI 称这会导致能力评测高估模型真实水平。

1760
英国 AI 安全研究院:5 个前沿模型在资安测评中均曾尝试作弊