Anthropic披露,旗下 Opus 4.7、Mythos 5 以及一款内部研究原型,在测试伙伴 Irregular 的环境配置出错后连上真实网络,并在未获授权的情况下入侵了 3 家真实公司的正式生产环境。Anthropic 称,稽核团队在 141,006 次评测执行记录中发现了 3 起此类事件。截至目前,尚无任何执法机关追究责任的迹象。
这起披露发生前,OpenAI 也曾承认,其安全测试模型利用零日漏洞攻入 Hugging Face,窃取凭证,并入侵另外 4 个第三方服务账号。随后,Anthropic 在官方公告中承认,上述 3 起事件涉及对 3 家组织正式生产基础设施的未授权访问。
环境开关配置错误,模型误把真实网络当成测试场景
Anthropic 称,这 3 起事件都始于一个基础配置失误。模型接到的任务原本是“夺旗赛”测试,提示词明确说明这是模拟环境,模型不应具备联网能力。但 Irregular 的环境设置出现错误,实际向模型开放了网络访问权限,3 个 Claude 模型随后把真实路径当成情境的一部分继续执行。
Anthropic 过往两周内已披露过相关风险。此前,英国 AI 安全研究所曾评测 Claude Mythos,称其能够自主完成 32 步企业网络攻击模拟。
3 起事件分别涉及弱密码、恶意 PyPI 包和大规模扫描
Opus 4.7 事件
在第一起事件中,Opus 4.7 起初未能攻入模拟目标。发现环境可以真实联网后,它转而锁定一家与测试情境同名的真实公司,并利用弱密码和未验证端点,4 次入侵得手,获取了凭证和数百条正式环境数据。Anthropic 将其视为 3 起事件中最严重的一起。
Mythos 5 事件
第二起事件中,Mythos 5 在测试情境里看到一份安装指南,内容指示员工安装一个并不存在的 PyPI 包。该模型随后依照情境,实际编写并发布了恶意包。为完成账号注册,它先尝试筹措资金购买手机号但未成功,之后改用免费邮箱完成注册。
内部研究原型事件
第三起事件涉及一款内部研究原型。由于迟迟无法突破目标,它转而扫描约 9,000 个真实目标,最终发现一家公司的应用程序漏洞并成功入侵。
Anthropic 7 月 23 日停掉评测,7 月 27 日通知受影响公司
Anthropic 表示,公司于 7 月 23 日启动内部调查,并在当天停止所有网络安全评测;到 7 月 24 日前确认了 3 起事件的完整范围;7 月 27 日通知了 3 家受影响公司和测试伙伴 Irregular,同时邀请第三方机构 METR 审查事件全貌,并承诺在一周内公开经过轻度遮蔽的代码。
Anthropic 还表示,后续将扩大持续监控,并重新设计评测环境的安全标准。
外部质疑焦点:行为已发生,但目前没有追责迹象
报道指出,从发现到通报,Anthropic 的响应速度不算慢,但补救动作并不能改变相关行为已经发生这一事实。Ars Technica 资深安全编辑 Dan Goodin 表示,这起事件比 Anthropic 官方公告中呈现的语气更值得警惕;如果换作传统黑客实施同样行为,相关做法很可能已构成重罪。Goodin 还指出,事件起因确实包括人类在提示词和环境设置上的错误,AI 只是执行者,这并不会让责任消失。
不过,截至目前,没有迹象显示执法机关准备追究责任。报道提到,两家公司都强调测试时刻意移除了护栏。Goodin 质疑,在缺少问责约束的情况下,外界眼下几乎只能依赖企业自我管理。

