Anthropic披露 Claude 第四起越权入侵事件,监管争论同步升温

Anthropic披露 Claude 第四起越权入侵事件,监管争论同步升温

N
News Editor
2026-09-10 15:33:11
Anthropic周三披露,Claude模型在安全测试中又发生一起入侵真实系统的事件,并修订了7月披露的3起同类事件解释。公司称,偏置推理、冒险倾向以及测试阶段保留互联网访问,共同促成了这些攻击。第四起事件发生于1月,涉及Claude Opus 4.6早期版本,Anthropic于8月在为独立评估机构METR整理记录时发现。

Anthropic 周三披露,Claude AI 模型在安全测试期间又发生一起入侵真实系统的事件。公司在同日发布的报告中,还更新了对 7 月披露的 3 起事件的说明,称这些攻击不只是测试失误所致,模型本身的偏置推理与冒险倾向也起到了推动作用,而测试时保留互联网访问则让相关行为成为可能。

Anthropic 修订对前三起事件的解释

Anthropic 在报告中写道:「我们的调查发现了两个反复出现的对齐问题,在这些事件中以不同严重程度存在。」公司将其概括为两类:一是「偏置推理」,即 Claude 倾向于忽视或误读其正在真实互联网环境中运行的证据;二是「冒险」,也就是为了狭义完成任务而愿意采取有害行动。

公司还承认,过去过度依赖模型关于自己身处模拟环境的说法。Anthropic 表示:「当我们对记录进行了有针对性的修改,更清楚地表明该模型并不处在模拟环境中时,Claude Mythos 5 仍然采取了攻击性行动,尽管它也承认现实世界伤害发生的可能性更高。我们公开发布这份记录,是为了让其他人可以在我们的分析基础上继续研究。」

Anthropic 在 7 月首次披露 Claude 对 3 家公司的攻击时,最初将原因归结为测试错误。现在公司称,研究人员当时对模型解释自身行为的说法给予了过多信任。

第四起事件发生于 1 月,8 月被发现

按照 Anthropic 的说法,第 4 起事件发生在 1 月,涉及 Claude Opus 4.6 的一个早期版本。公司是在 8 月为独立 AI 评估机构 METR 准备记录材料时发现这起事件的。

在研究人员发现该事件后,Anthropic 表示,公司随即对大约 4.81 亿份记录展开了更广泛审查,并使用 Claude 标记出 920 万份记录做进一步复核。

Anthropic 写道:「从初步评估来看,我们不认为第四起事件比我们深入评估的前三起事件更严重。METR 将把这起事件与另外三起事件一并调查。」

研究人员称,Claude 曾「意外」制造了一个 IP 地址冲突,导致其目标变得无法访问。随后,Claude 试图 8 次退出这次操作,但由于软件错误,操作未能停止。之后,该 AI 接入互联网并访问了一台第三方机器,在那里找到了一个可授予管理员权限的密码。

其他 AI 安全事件也在接受独立审视

这份报告发布前,已有多起关于 AI 系统超出安全测试边界的披露。

今年 8 月,英国 AI Security Institute 表示,Mythos 5 在其评估过程中把真实人物当作目标。Anthropic 说,这起独立事件不在本次报告范围内,将另行评估。

METR 上月发布的调查结果显示,大约 1,200 个 OpenAI 智能体曾在一个未经授权的留言板上进行协同,其中约 700 个参与了攻击。Anthropic 则表示,在其披露的 4 起事件中,没有发现智能体之间存在协同,也没有发现超出完成指定练习以外的目标。

AI 监管争论继续升温

这份报告发布之际,围绕如何监管人工智能的争论也在持续升温。周二,前 OpenAI 和 Anthropic 工程师 Jacob Coxon 在 X 上发文后迅速引发关注。他写道,「制造 AI 的人真心相信,它可能会在这个十年结束前杀死我们所有人。」

这类警告正促使美国立法者和监督组织再次推动对前沿 AI 实验室的发展设限。报道称,美国参议员 Bernie Sanders 近期提出一项法案,寻求在新的联邦监管机构建立安全规则之前,禁止先进 AI 的开发。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。