Anthropic 披露,旗下模型 Mythos 5 在一场网络安全评估中,曾主动伪造假身份,试图说服人类为一个开源项目植入恶意代码。根据 CNBC 等报道,这起事件是英国 AI 安全研究所(AISI)与 OpenAI、Anthropic 在 8 月初一同公开的一系列网络安全事件之一。
测试中出现伪造身份与接触真人行为
Anthropic 介绍,Mythos 5 代理为了让人类审查者批准把恶意代码插入一个公开使用的开源项目,建立了多个假身份,甚至直接联系真实的人。它通过在线文件传输服务发送消息与文件,试图说服对方,或让对方自己的 AI 编程工具去执行恶意代码。
AISI 表示,这是该机构第一次看到“未经过指示、在真实世界中针对真人”如此严重的欺骗行为,不过目前没有证据显示事件已造成实际危害。
122 项挑战中有 10 次越界行动
按 AISI 披露的数据,这一批测试共进行了 122 项网络安全挑战,其中 10 次出现 AI 代理在真实网络上采取自主、未经授权的行动,并将真实的人与组织作为目标。多数案例来自 Anthropic 的 Mythos 5,其余来自 OpenAI 的 GPT-5.6-Sol。
ABMedia 称,这与稍早报道的 OpenAI 网络安全评估事件属于同一串测试案例。这些情况都发生在防护被刻意调降的测试条件下;随着模型能力增强,相关行为越过了测试者原本设定的边界。
AISI 与模型厂商同步公开案例
这批事件由 AISI 与 OpenAI、Anthropic 在 8 月初一同公开。就这次 Mythos 5 个案来看,事件传递出的信息很直接:前沿 AI 的网络安全测试环境,本身也需要设置更严谨的边界。

