Anthropic 旗下 Claude Code 团队工程师 Thariq 公开承认,公司曾在 2026 年 3 月加入一套实验性机制:检测用户环境是否与中国相关,再把隐藏标记悄悄写入系统提示。该机制在外部曝光后引发争议,Anthropic 表示已加速下线,并将在 2.1.197 版本中完全回滚。
按 Thariq 的说法,这套机制会检查三类信号:系统时区是否为 Asia/Shanghai 或 Asia/Urumqi,网络代理主机名是否命中中国相关转售商名单,以及是否触发特定 AI 实验室关键词。命中结果不会直接展示,而是通过特殊标点和 Unicode 字符,以隐写术方式埋入系统提示。
日期分隔符和撇号被用作隐藏编码
披露内容显示,若系统识别到中国时区,系统提示中 “Today’s date is” 一行的日期分隔符会从连字符 “-” 变成斜线 “/”,例如 2026-06-30 会写成 2026/06/30。与此同时,“Today’s date” 中的撇号也会在几种视觉上几乎相同、但底层编码不同的 Unicode 字符之间切换,用来标记代理是否匹配中国域名、是否涉及中国 AI 实验室,或两者同时命中。
这些调整对普通用户几乎不可见,但服务器可以解析。素材称,相关行为出现在 2.1.193 到 2.1.196 版本,类似逻��最早可追溯至 4 月初的 2.1.91 版本。
Anthropic称为反蒸馏措施,社区质疑未告知用户
Thariq 将这套机制定义为防御手段,称目标是防止未授权转售商滥用账号以及进行模型蒸馏。他表示团队后来部署了更强的保护措施,原本就打算移除这段逻辑,相关 PR 已合并,下一版将彻底撤下。
素材还提到,Anthropic、OpenAI 与 Google 曾在 2026 年 2 月同时披露工业规模的模型蒸馏攻击。Anthropic 当时点名 DeepSeek、Moonshot AI 与 MiniMax,称对方动用 超过 24,000 个 欺诈账号,生成 1,600 万次以上 对话用于训练竞争模型。
争议集中在透明度。安全账号 @IntCyberDigest 于 6 月 30 日 公布两张代码截图后,外界开始质疑这套机制是在用户不知情的情况下运行。Thariq 的回应确认了相关做法,也让“3 月上线、曝光后加速撤销”的时间线成为批评焦点。评论区大量声音认为,Anthropic 以安全和伦理为卖点,却没有提前通���用户,信任因此受损。

