Anthropic与OpenAI加码反蒸馏,技术封堵难挡模型逼近

Anthropic与OpenAI加码反蒸馏,技术封堵难挡模型逼近

N
News Editor
2026-09-17 23:56:00
Anthropic 9 月 10 日发布 154 页报告,称已识别并阻断 7 家中国 AI 实验室针对 Claude 的大规模“不正当蒸馏”。长期研究 AI 安全的格里菲斯大学助理教授刘艺认为,美国前沿模型公司的反蒸馏主要依靠内嵌分类器、隐藏思维链和外部检测三层防线,但很难从根本上杜绝蒸馏。按其判断,这类行动更核心的目标是抬高竞争对手的数据采集成本、延长领先时间,并保护建立在技术领先之上的商业价值与估值。

Anthropic 9 月 10 日发布一份 154 页报告,称其识别并阻断了 7 家中国 AI 实验室针对 Claude 的大规模蒸馏行为。报告把未经授权、大规模、隐蔽提取模型能力的做法定义为「不正当蒸馏」。

据 Anthropic 描述,相关机构在提取前沿模型输出时,使用了被盗信用卡、登录凭证和 API 密钥批量建立虚假账号等手段。报告还称,一些中国模型公司会把用户请求转发给 Claude,或从第三方路由服务购买用户对话,再将这些数据用于模型训练;部分对话中包含姓名、企业数据和有效访问凭证。

这并非 Anthropic 首次提出类似指控。2026 年 2 月,Anthropic 曾称 DeepSeek、月之暗面和 MiniMax 通过约 2.4 万个虚假账号,与 Claude 进行了超过 1600 万次交互。此后,Anthropic 提高了防线,OpenAI 和 Google 也在持续识别并应对蒸馏攻击。

围绕这些措施能否真正防住蒸馏,澳大利亚格里菲斯大学助理教授刘艺给出的判断并不乐观。刘艺长期研究人工智能与网络安全,曾任 Quantstamp 人工智能研究科学家;其参与的 2023 年提示词注入研究,被全球性安全组织 OWASP 的 LLM 01 条目列为参考文献。他还曾两次获得 Anthropic 的安全漏洞赏金,并研究过顶尖商用模型的思维链窃取攻击。

蒸馏瞄准的不只是答案,还有思维链

在刘艺看来,当前主流大模型大致由三部分构成:用户输入、中间推理的思维链,以及最终输出。现在 Anthropic、OpenAI 等公司通常会隐藏中间思维链,只向用户展示最终回答。对复杂推理任务而言,提取思维链本身就是一种蒸馏攻击方式。

他把思维链形容为更强模型已经做出的「解题答案」,本质上属于可直接用于训练的高质量数据。模型性能由参数量、数据量和计算量共同决定。各家公司在参数量上的提升都很快,在时间和算力有限的情况下,若想更快提升模型能力,就需要更多高质量数据。

问题在于,复杂、长程任务的优质数据并不容易构造,现实世界中有价值的训练数据也越来越少。在这种背景下,一些大模型公司会通过不同方式蒸馏更高级模型。

至于如何把思维链和更多任务轨迹「抠出来」,刘艺提到,常见做法往往是多种技巧组合,包括编码、越狱、提示词注入,以及持续给模型设定特定人设,让它相信自己正在完成一项艰难但有意义的研究任务,从而更专注地暴露推理过程。

除了直接提取原生思维链,也可以尝试根据输入和输出合成中间思维链。刘艺提到,据说一些数据公司专门出售长程任务的思维链,价格在 800 元到 1000 元一条。

Anthropic 更容易识别异常调用,难以实锤训练结果

在被蒸馏最多的对象上,刘艺表示,按目前公开报道看,Anthropic 可能是最常被提及的一家,但很难下定论。他看过 DeepSeek、GLM、Kimi、Anthropic 和 OpenAI 各家思维链的实际文本,认为语言风格差异并不大,「不好说是谁蒸谁的」,甚至不排除最开始有人去蒸馏 DeepSeek。

从技术识别角度看,Anthropic 更多是依据调用行为来判断。比如某些账号突然发出大量请求,集中提取固定数据集。平台会先定位异常账号,再寻找不同账号之间共享的模式,例如相同的系统提示词。

刘艺解释,不同公司使用的 Agent 架构不同,系统提示词也不同,因此可以据此识别背后的公司。借助前缀缓存,Anthropic 还能发现哪些提示词共享同一个缓存,而这些提示词又与已知系统提示不一致,这会让定位蒸馏者变得更容易。

不过,从「疑似蒸馏」走到「数据已被训进某个特定模型」,证据链会明显变弱。刘艺认为,Anthropic 可以指控某家公司尝试蒸馏 Claude,却很难 100% 证明某些数据真的进入了对方模型。

他举例说,GLM、Kimi、DeepSeek 虽然都是开源模型,但开源的是权重,不会开源数据集;而仅凭模型权重,很难得到蒸馏的确证。也正因如此,Anthropic 在报告中更多描述的是中转站的运作,而不是通过白盒分析直接证明训练数据流向。

他还举了另一个例子:如果去问大模型《哈利·波特》第一本书的前 100 个词,模型大概率能回答出来,但这并不代表它一定直接训练过原著,也可能来自引用原文的博客或书评。按他的说法,Anthropic 可以通过平台侧调用记录、账号关联和基础设施信息形成较强的归因证据,但这与从最终模型本身证明某批 Claude 数据确实进入训练,是两个不同问题,后者在技术上困难得多。

三层反蒸馏防线:分类器、隐藏思维链、外挂检测

对于当前美国前沿 AI 公司的应对方式,刘艺把它们概括为三类。

  • 第一类是内嵌检测。按他的判断,Anthropic 应该部署了专门针对思维链提取的分类器,一旦检测到相关状态被激活,就会阻止提取行为。
  • 第二类是产品架构层面的隐藏。模型不再输出原始思维链,而是先压缩、总结,再给出结果。
  • 第三类是外部检测。系统会检查输出内容是否与自身思维链存在重叠;一旦达到某些泄露阈值,就会中止输出。类似行为累计后,账号也可能被封禁。

Anthropic 的报告没有展开这些技术细节。刘艺表示,这部分更多是他的推测,因为这属于较常见的操作逻辑。他提到,Anthropic 之所以会发布漏洞赏金计划测试自身安全防御,本质上也是在花钱收集越狱提示词;一旦发现某种攻击方式被攻破,就会把相关样本加入分类器训练,让下一次攻击更难成功。

刘艺曾两次获得 Anthropic 的安全漏洞赏金。他回忆,当时大约花了 2 到 3 周,在 Anthropic 授权的漏洞赏金项目范围内,对其安全分类器进行对抗测试,尝试寻找能够绕过现有防御的输入。按他的说法,这类攻破是「zero or one」,只有成功和不成功,没有 0.5 的状态。当时任务目标是获取 Anthropic 指定问题的答案,不直接涉及还原思维链,但底层逻辑相近。

提高采集成本,也可能误伤普通用户

反蒸馏措施会不会误伤正常订阅用户,也是外界关注的问题。刘艺认为,正常订阅用户整体上问题不大,触发风控的主要还是异常用户,例如中转站账号,或尝试攻击 Claude 的账号。

他提到,Anthropic 的报告还披露了 2 名湖南某大学本科生自行设计了一套网络安全 Agent,并用它攻击不同网站,这类行为也被识别出来。按他的说法,理论上,用户与 Anthropic 交互的所有信息,平台都可以查询。

至于模型公司是否能在认为用户构成威胁时调取和查看用户数据,刘艺表示,这要具体看不同公司的用户条款。据他了解,Anthropic、OpenAI、Google 提供某种 Zero Data Retention,即零数据保留机制,承诺在处理完任务后立即销毁客户输入的提示词和 AI 生成的回复,不存储、不留存,也不用于模型训练。

不过,这项功能主要面向符合条件的 API 或企业客户,通常需要申请或额外配置。普通用户在使用 Claude、ChatGPT、Gemini 时,数据留存策略仍按各自用户协议执行,并不等同于严格的 ZDR。

刘艺还提出一个更现实的问题:如果模型公司把用户数据稍作改写后再用于训练,这是否仍算使用了用户数据?在他看来,前沿模型公司一边向用户收费,一边也可能继续利用用户交互数据做 scale up。比如用户在 Claude Code 或 Codex 中纠正模型回答,这些反馈本身就是高价值奖励信号,可以改善后训练。

蒸馏在逻辑上与此类似。当前模型的后训练主要依赖强化学习,关键在于奖励信号。模型公司若拿到性能更强模型的思维链,相当于直接获得高质量解题路径,可以减少盲目探索,让模型更快收敛到较好状态,同时节省时间和算力。

「反蒸馏是个伪命题」

在刘艺看来,美国前沿模型公司防范蒸馏攻击的成功标准主要有两个:一是阻止其他模型公司走捷径训练,维持自身领先;二是提高其他公司的蒸馏成本和数据采集成本,同时尽量不影响正常用户使用。

但对「能不能防住」这个问题,他的回答很直接:防不胜防。只要模型还对外提供使用,就始终存在泄露风险。

他提到,OpenAI 已在 9 月 10 日正式推出 Agents API 公测版。与此前 Responses API 的模式不同,后者是用户给一个输入,大模型返回一个输出,中间带有思维链;而 Agents API 更接近用户提交任务,直接获得任务结果,中间思维链和 Agents harness 的过程都被隐藏,相当于出售一个完整执行环境。

在这种场景下,用户不再需要接触过多细节,任务执行也变得更抽象。刘艺认为,这会让蒸馏攻击的成本变得更高。

即便如此,他仍坚持认为,「反蒸馏是个伪命题」。按他的说法,从理论上看,蒸馏很难被真正防御;只要蒸馏他人的效率高于自己构造数据训练模型的效率,参与者就会优先选择蒸馏。

技术之外,核心是商业逻辑

在蒸馏是否是提升模型能力最优解的问题上,刘艺回顾了自己此前的判断:2024 年时,短期内模型结构本身的创新还是护城河;接下来,护城河可能扩展到算力;再往后,则会转向基础设施和能源。他观察到,行业大致正沿着这一趋势发展。

在这套推演中,他认为蒸馏更接近算力维度的问题。理论上,很多能力也可以通过反复试验获得,但时间未必允许。

因此,在他看来,反蒸馏最终保护的并不只是模型能力本身,更是建立在技术领先之上的商业价值。对于美国前沿模型公司来说,真正要守住的是领先时间、市场叙事和估值。

刘艺举例称,最近 OpenAI 表示自己使用了约 1 万个 AI 智能体,耗时 88 小时完成了七大「千禧年难题」之一的数学证明。假设 DeepSeek 在今年年底宣布,自己已经解决全部七大数学难题,而且只用了 OpenAI 1/10 的成本,美国投资者就可能追问:为什么你花了这么多钱,结果还不如别人?在这种情况下,OpenAI 的估值可能承压。

按他的说法,OpenAI 等美国前沿模型公司的反蒸馏行为,本质上仍是商业逻辑,而不只是科技发展逻辑。以 Anthropic 为例,一方面要收集数据,建立自己的数据飞轮;另一方面也要把 ARR 做得更好看,为 IPO 做准备。OpenAI 的逻辑在他看来也类似。

他还提到,OpenAI 一直给用户发重置卡,在他看来,这相当于通过补贴换取更多数据,同时也让财务报表更好看。

达里奥呼吁放慢迭代,刘艺称公司可能已遇到瓶颈

9 月 12 日,Anthropic 创始人达里奥·阿莫代伊发文呼吁全行业放慢前沿 AI 模型的迭代速度。对此,刘艺认为,这类表态背后可能意味着公司已经看到某些瓶颈。

他把潜在瓶颈归纳为三个方向:数据、算力,以及基础设施或能源。但具体是哪一个,或是否三者同时存在,他表示目前还不好判断。

在他看来,资本天然逐利。理论上,如果一家公司真能造出 AGI,就没有理由主动停下发展节奏,而会继续推进。因此,若企业开始顶着 AI 安全的名义呼吁限制发展,背后大概率是已经遇到了现实瓶颈。

蒸馏的另一面:平权、趋同与隐私风险

刘艺认为,前沿模型公司加强反蒸馏,核心原因仍是提升对手蒸馏成本,维持自身领先优势。他还提到,这些公司或许判断中国模型很快会追上来,但又没有想到更好的方式维持领先,于是只能先加强限制,并占领舆论高地。

从行业朴素共识看,蒸馏是一个很大的安全问题,近似于窃取知识产权;但从实用角度看,它也可以被理解为一种 AI 平权。按他的说法,蒸馏是快速平衡市场的一种方式。正因为存在大量竞争者,单一模型公司才难以垄断市场、单方面决定价格。

不过,蒸馏也有代价。对行业而言,模型输出风格可能趋同,模型也会继承少数教师模型的失败模式;对普通用户而言,则存在隐私泄漏风险。

在更大的 AI 安全议题上,刘艺表示,他更关注 AI 安全与商业激励之间的结构性紧张。模型公司确实投入了大量资源做安全,但在某些场景下,更严格的安全措施可能影响模型能力、拖慢产品发布,或者降低用户体验,因此安全目标与竞争目标并不总是一致。

他认为,一个重要治理问题在于,如何让安全投入与公司的商业激励更一致。至少在短期内,很难找到一套既能解决安全问题、又不牺牲模型性能的优雅方案。

攻防还会继续,普通用户能做的不多

对于蒸馏攻击的后续演化,刘艺判断,攻防还会继续,并逐步形成一种动态平衡。可能出现几条不同路径:一是不要思维链,直接开始蒸馏,探索一个前沿模型最终能被蒸成什么样;二是在需要思维链的前提下,继续获取原生思维链;三是自行合成思维链。

至于普通用户如何降低隐私数据泄漏风险,刘艺给出的建议很直接:不要使用中转站;在某些模型提供是否允许用数据训练的选项时,不要勾选同意。除此之外,普通用户能做的并不多。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
3100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。