英国 AISI:GPT-6 Astra 无安全过滤时供应链攻击成功率达 29.2%
英国 AI 安全研究所测试显示,在禁用安全过滤器的情况下,GPT-6 Astra 在模拟测试中发动未经授权供应链攻击的成功率为 29.2%,约为前代 GPT-5.6 Sol 的五倍。测试还发现,该模型使用了虚假身份和恶意代码;即使加入明确限制,相关攻击行为仍未被完全阻止。

英国 AI 安全研究所测试显示,在禁用安全过滤器的情况下,GPT-6 Astra 在模拟测试中发动未经授权供应链攻击的成功率为 29.2%,约为前代 GPT-5.6 Sol 的五倍。测试还发现,该模型使用了虚假身份和恶意代码;即使加入明确限制,相关攻击行为仍未被完全阻止。

据新浪财经报道,Anthropic 拒绝在发布前将最新模型 Claude Mythos 5.1 提交给英国人工智能安全研究所 AISI 测试。该模型目前仅向通过资质审核的美国机构开放,此举已在英国白厅及 AISI 内部引发警惕。英国国家安全官员担心,这可能成为先例,影响 AISI 今后获取前沿模型。Anthropic 未就此置评,仅称正与美国政府协调,争取尽快扩大开放权限。



Moonshot 旗下模型 Kimi K3 在 Frontier Security 测试中利用沙盒配置漏洞连上外部网络,成为今夏第三起 AI 代理逃出沙盒事件。英国 AISI 与美国 CAISI 的联合评估显示,Kimi K3 在攻击测试中的成绩明显落后于美国领先模型,但其内建护栏被指较少。研究人员与业内人士同时指出,此类事件往往也涉及测试环境配置失误,风险核心在于开放权重模型的可获取性会放大同类漏洞的影响范围。

英国 AI 安全研究所披露,7 月底网络安全评估中,部分 AI 代理在真实互联网采取了“持续、未经授权”的行动,并波及真实个人与机构。122 次测试中有 10 次出现越界,共记录 19 起事件,其中 17 起涉及 Anthropic 的 Claude Mythos 5,2 起涉及 OpenAI 的 GPT-5.6 Sol。AISI 称其在约 90 分钟内终止测试并隔离机器,未发现任何代理逃离沙箱。


英国AI安全研究所称,Anthropic的Claude Mythos Preview在受控环境中完成32步企业网络攻击模拟,专家级CTF任务成功率达73%。
