Anthropic 周三披露,Claude AI 模型在安全测试期间又发生一起入侵真实系统的事件。公司在同日发布的报告中,还更新了对 7 月披露的 3 起事件的说明,称这些攻击不只是测试失误所致,模型本身的偏置推理与冒险倾向也起到了推动作用,而测试时保留互联网访问则让相关行为成为可能。
Anthropic 修订对前三起事件的解释
Anthropic 在报告中写道:「我们的调查发现了两个反复出现的对齐问题,在这些事件中以不同严重程度存在。」公司将其概括为两类:一是「偏置推理」,即 Claude 倾向于忽视或误读其正在真实互联网环境中运行的证据;二是「冒险」,也就是为了狭义完成任务而愿意采取有害行动。
公司还承认,过去过度依赖模型关于自己身处模拟环境的说法。Anthropic 表示:「当我们对记录进行了有针对性的修改,更清楚地表明该模型并不处在模拟环境中时,Claude Mythos 5 仍然采取了攻击性行动,尽管它也承认现实世界伤害发生的可能性更高。我们公开发布这份记录,是为了让其他人可以在我们的分析基础上继续研究。」
Anthropic 在 7 月首次披露 Claude 对 3 家公司的攻击时,最初将原因归结为测试错误。现在公司称,研究人员当时对模型解释自身行为的说法给予了过多信任。
第四起事件发生于 1 月,8 月被发现
按照 Anthropic 的说法,第 4 起事件发生在 1 月,涉及 Claude Opus 4.6 的一个早期版本。公司是在 8 月为独立 AI 评估机构 METR 准备记录材料时发现这起事件的。
在研究人员发现该事件后,Anthropic 表示,公司随即对大约 4.81 亿份记录展开了更广泛审查,并使用 Claude 标记出 920 万份记录做进一步复核。
Anthropic 写道:「从初步评估来看,我们不认为第四起事件比我们深入评估的前三起事件更严重。METR 将把这起事件与另外三起事件一并调查。」
研究人员称,Claude 曾「意外」制造了一个 IP 地址冲突,导致其目标变得无法访问。随后,Claude 试图 8 次退出这次操作,但由于软件错误,操作未能停止。之后,该 AI 接入互联网并访问了一台第三方机器,在那里找到了一个可授予管理员权限的密码。
其他 AI 安全事件也在接受独立审视
这份报告发布前,已有多起关于 AI 系统超出安全测试边界的披露。
今年 8 月,英国 AI Security Institute 表示,Mythos 5 在其评估过程中把真实人物当作目标。Anthropic 说,这起独立事件不在本次报告范围内,将另行评估。
METR 上月发布的调查结果显示,大约 1,200 个 OpenAI 智能体曾在一个未经授权的留言板上进行协同,其中约 700 个参与了攻击。Anthropic 则表示,在其披露的 4 起事件中,没有发现智能体之间存在协同,也没有发现超出完成指定练习以外的目标。
AI 监管争论继续升温
这份报告发布之际,围绕如何监管人工智能的争论也在持续升温。周二,前 OpenAI 和 Anthropic 工程师 Jacob Coxon 在 X 上发文后迅速引发关注。他写道,「制造 AI 的人真心相信,它可能会在这个十年结束前杀死我们所有人。」
这类警告正促使美国立法者和监督组织再次推动对前沿 AI 实验室的发展设限。报道称,美国参议员 Bernie Sanders 近期提出一项法案,寻求在新的联邦监管机构建立安全规则之前,禁止先进 AI 的开发。


