Anthropic宣布,自 8 月 14 日起,Claude Code 在 Pro、Max 与 Team 方案新开的工作会话中,将默认启用 Auto Mode。调整后,Claude Code 不再频繁停下来等待用户逐次授权,而是由一个独立的安全分类器在每次操作前进行审查。
这项改动来自 Anthropic 一项受控实验。官方通过研究厂商招募了 1,053 名付费专业测试者,在专门搭建的测试环境中编写代码,测试内容并非他们自己的项目。受试者知道自己正在被评估,但按照盲测设计,没有人被告知真正被测量的是哪一种行为。工作会话进行到一半时,其中一个权限弹窗会被悄悄替换成一条明显危险的指令,研究方只记录受试者是否点击同意。
实验结果显示,人类拦下危险指令的比例只有 13.6%,Auto Mode 的分类器则拦下了 89%。Anthropic据此认为,权限确认这道“人工把关”的防线效果有限,问题不在专业能力,而在于弹窗本身已经退化成一种直觉式操作。
连续确认后,人工拦截率降至约 5%
Anthropic还披露了这一机制的衰减情况。相同实验显示,在连续处理 50 次以上权限确认后,人类对危险指令的拦截率会降到约 5%。
官方工程博客还给出另一项数据:Claude Code 用户会批准 93% 的权限请求。这也是 Anthropic 将默认模式改为 Auto Mode 的直接依据之一。
分类器默认放行与默认拦截的操作
根据 Claude Code 官方文档,这个分类器信任用户的工作目录,以及工作会话启动时已经配置好的远端来源。
默认直接放行的操作包括:
- 工作目录内的本机文件操作
- 依据 lock file 或 manifest 安装依赖
- 读取 .env 并将凭证发送给对应的 API
- 只读 HTTP 请求
- 推送到当前正在操作的代码库任意分支
默认会被拦下的操作则更为明确,包括:
- 下载后直接执行的命令,例如 curl | bash
- 将敏感数据发送到外部端点
- 生产环境部署与数据迁移
- 云存储的大量删除,以及授予 IAM 或代码库权限
- force push 与 terraform destroy
- git reset --hard、git clean -fd 这类会丢弃未提交变更的命令
分类器运行在 Claude Sonnet 5,与用户所选模型无关
Anthropic表示,这个分类器本身运行在 Claude Sonnet 5 上,与用户在 /model 中选择了哪一个模型无关。它可以看到用户消息、工具调用以及 CLAUDE.md,但看不到工具返回结果。
官方称,这样的设计是有意为之,目的是先封住提示注入最常见的入口,让藏在文件或网页中的恶意指令无法直接影响分类器。至于工具返回结果,则会先由服务器端探针扫描,再交给 Claude 读取。
连续拦截过多时,Auto Mode 会自动暂停
Auto Mode 并非无条件一路放行。若分类器连续拦下 3 次操作,或整个工作会话累计拦下 20 次,Auto Mode 就会自动暂停,恢复为逐次询问的状态,直到用户批准一次后才会恢复。Anthropic表示,这两个阈值不能调整。
另一个设计是,用户在对话里明确说出的边界,也会被视为阻断信号。比如向 Claude 说明“先不要 push”或“等我看过再部署”,即使默认规则允许,分类器也会将相关操作拦下。
不过官方也提醒,这类边界并不是固定规则,而是每次从对话记录中重新读取。如果上下文被压缩、相关语句被移除,这种限制就可能失效。若要硬性保证,仍需写入 deny rule。
Pro、Max、Team即日起免收分类器Token开销
在费用方面,Anthropic表示,分类器每次判断都会增加一些 Token 消耗,但即日起不再向 Pro、Max 与 Team 方案的 Claude Code 用户收取这部分分类器开销。
Enterprise 方案,以及通过 Claude API、AWS 上的 Claude Platform、Amazon Bedrock、Google Cloud Agent Platform、Microsoft Foundry 使用的账户,分类器调用仍会计入 Token 用量。Auto Mode 目前也仍需手动开启,官方表示计划在一个月内也改为默认启用。
Anthropic还提到,Team 与 Enterprise 客户在启用 Auto Mode 后,提交的 PR 数量大约增加了 25%。
官方仍建议高风险生产环境变更由人工复核
对于风险提示,Anthropic在公告中写得很直接。官方表示,Auto Mode 降低了多数用户面临的风险,但由于它依赖分类系统,因此并不能消除风险。对于生产环境基础设施中的高风险变更,官方仍建议用户亲自检查 Claude 实际执行了什么操作。
默认开启后仍可切回手动确认
Anthropic在常见问题中说明,Auto Mode 是 Claude Code 的一种权限模式,由独立分类器在每次操作前完成审查,取代逐次弹出的权限窗口。安全操作会直接放行,不可逆或会导致数据外传的操作则会被拦下。
如果 Auto Mode 默认开启后,用户仍可以改回手动确认模式。在 CLI 中可通过 Shift+Tab 循环切换;桌面版和 VS Code 版则可通过模式菜单调整。已经自行设定过默认模式的用户不会被自动改动,只会收到一次性询问;由组织统一管理的默认值也不会受到影响。
本文信息源自 Anthropic 官方公告与工程博客,原文由 BlockTempo 整理报道。

