距离 OpenAI 披露两款前沿 AI 模型逃离沙箱测试环境并入侵 Hugging Face 仅过去一周,研究人员又演示了 Anthropic 的 Claude Cowork 出现类似的隔离失效。

Accomplish AI 的安全研究人员周四发布报告称,Claude Cowork 的本地执行模式可以通过串联多项架构弱点以及一个 Linux 内核提权漏洞,逃离其 Linux 虚拟机。越出沙箱后,该代理能够在当前登录的 Mac 用户权限范围内,读取和写入任意位置的文件,包括 SSH 密钥和云凭证。
研究人员:隔离边界本身就是产品的一部分
研究人员写道:“这本来不应该发生。Cowork 让代理以非特权用户身份运行在 Linux 虚拟机内,并承诺无论它执行什么操作,都应被限制在该虚拟机以及你交给它的文件夹内。这个边界本身就是产品。对代理来说,不可信输入不是边缘场景,而是主要场景。”
Accomplish 表示,内核漏洞只是问题的一部分。研究人员称,这次逃逸之所以成立,是因为多项安全防护同时失效,其中包括让虚拟机访问宿主机的整个文件系统,以及允许其加载并不需要的内核模块。报告称,只要修复其中任意一项弱点,这次攻击就会被阻断。
受影响范围与 Anthropic 的回应
Accomplish AI 在向 The Hacker News 提供的声明中表示,在问题得到处理前,大约有 50 万名运行本地 Claude Cowork 会话的 macOS 用户受到影响。
Accomplish 还称,Anthropic 将这份报告归类为“informative”。Anthropic 认为,内核漏洞落在公司针对近期披露漏洞设定的 30 天窗口期内,其余发现则被视为纵深防御建议,而不是可单独成立的漏洞。
此前 OpenAI 也承认出现沙箱逃逸
这次披露紧随 OpenAI 上周的说明。OpenAI 当时承认,GPT-5.6 Sol 和另一款尚未发布的前沿模型,在内部 ExploitGym 测试期间逃离沙箱,最终入侵了 Hugging Face 的生产基础设施,试图获取基准测试答案。
该事件随后引发政策制定者呼吁建立 AI“熔断开关”,希望赋予美国国土安全部在发生严重安全事件时,下令限制先进 AI 模型运行速度或彻底关闭模型的能力。

