Anthropic 于 8 月 11 日宣布,Claude 最新模型生成的文字将全面嵌入人眼不可见的隐形水印,图片则附加 C2PA 数字签章,用来回应欧盟 AI 法的透明度要求。根据其安排,8 月 2 日起在欧盟推出的模型先适用,随后再扩展到全球。
就在 Anthropic 公布这项措施的同一天,开发者 Guillaume Meyer 在 GitHub 创建了一个项目。该项目在 8 月 13 日累计 4,102 星,BlockTempo 查询时已升至 8,983 星,另有 919 个分支,短时间内热度继续上升。
这个项目最初名为 remove-claude-marks,现在改名为 watermarks-remover,采用 MIT 许可协议,并以 Python 编写。项目说明中的迁移记录显示,它原来的名称确实是 remove-claude-marks,旧的调用指令 /remove-claude-marks 目前也仍然保留。
项目称可处理 3 类来源标记
按照项目说明,其处理方式分成 3 层。
- 第一层针对肉眼不可见的 Unicode 字符,包括异常空格、双向控制码和标签字符,使用固定规则程序清理。
- 第二层针对统计式文字水印,也就是模型在选词时加入的信号,做法是调用另一个模型把整段内容重写一遍。
- 文件层则移除 C2PA 签章以及 EXIF、XMP 等元数据,支持 PNG、JPEG、WebP、SVG、PDF、DOCX、ODT、HTML 和 Markdown。
项目列出的覆盖范围包括 Claude、Gemini 的 SynthID-Text、OpenAI 的来源标记,以及开源模型常见的 Kirchenbauer 式标记。它还将自己包装为一个可由 AI 代理直接调用的技能,安装后可通过一句 /remove-ai-marks 运行。项目说明称,这样做是为了自己拥有内容的隐私与整洁。
移除效果目前无法验证
这起事件中最关键的问题在于,Anthropic 虽然加入了水印,但并未公开对应检测器。在没有检测器的情况下,外界无法验证一段文字中的标记是否真的被完全移除,项目作者自己也无法证明这一点。
BleepingComputer 也提到,类似的 AI 水印移除工具正在不断出现,但几乎没有哪一个能够证明自己确实有效。
其中,第二层针对统计式水印的做法,本质上是让另一个模型将整段文章重写,替换词汇、调整子句顺序、改写转折语和句子边界。这种方式或许可能破坏埋在选词概率中的信号,但走到这一步,输出内容实际上已经变成另一篇文章。
按目前已知信息,较容易确认被移除的是那些可按规则处理的内容,例如隐形 Unicode 字符和文件元数据;至于统计式文字水印,现阶段更多是在依赖“重写”来尝试破坏其信号,效果没有证据支撑。
围绕 AI 水印的攻防仍在继续
从时间线看,围绕 AI 生成内容标记的动作今年已多次出现。7 月,YouTube 对 3 类 AI 虚假原创内容切断变现;同月,欧盟开始执行透明度规定,未自报身份最高可罚全球营收的 3%;8 月初,Suno 宣布为 AI 生成音乐加入水印;8 月 11 日,Claude 也开始推进同类安排。
在这条路径下,监管将标记变成义务,厂商需要加入签章;而只要签章存在,就会有人尝试做移除工具。这个 GitHub 项目在 3 天内逼近 9000 星,显示出相关需求相当明显。
不过,至少在检测器公开之前,双方都拿不出决定性的证据。Anthropic 无法证明其水印能否稳定留存,工具作者也无法证明自己是否真的完成了清除。现阶段,关于效果的说法都还缺少可核验依据。
已披露的相关信息
Anthropic 这次措施被描述为对欧盟 AI 法透明度行为准则的回应。BlockTempo 在原文中提到,网络上的反应并不算好,部分社群用户担心水印会暴露自己在工作或学校作业中使用 AI 的情况。
原文还提到,欧盟 8 月开始执行相关要求,未自报身份最高可罚全球营收 3%,台湾也在适用范围内。

