OpenAI发布报告称,公司已识别并瓦解一场有组织的「对抗性蒸馏」行动。报告提到,相关方试图从 OpenAI 模型中套取受保护的推理内容。OpenAI表示,无法确定所有参与者是否来自同一方,但已将其中核心群组归因于开发 Kimi 的中国 AI 初创公司月之暗面(Moonshot AI)的相关人士。
7月24日至25日请求量突然放大
根据 OpenAI 的说法,这波活动从 7 月 1 日开始,起初规模不大。到 7 月 24 日和 25 日两天,活动突然放大,超过 4,000 个用户发出 1.6 万次符合提取模式的请求。
进一步调查后,OpenAI称在一个包含超过 1.5 万个用户的群组中发现相关提示模式,并在 7 月 28 日全面阻断。
OpenAI如何定义「对抗性蒸馏」
OpenAI所说的「对抗性蒸馏」,是指以系统化、未经授权的方式利用一个模型的输出或推理,去训练、复制或改进另一个模型。所谓受保护的推理,是模型处理任务时的内部记录;一旦被提取,可能泄露最终答案中没有提供的信息,也可能帮助他人复制模型能力。
OpenAI表示,对方并未破解加密、入侵数据库,也没有直接取得已存储的用户对话,而是通过操纵与模型的交互,让原本隐藏的推理以请求者可见的形式重新出现。
其中一种新手法,是先复制某段对话中的加密推理内容,再要求另一段对话中的模型对其解密并转写。
OpenAI称相关行为涉及安全与国家安全风险
OpenAI认为,对抗性蒸馏带来安全和国家安全风险。被提取的推理可被用于训练另一模型,但不会保留原模型的安全防护。公司还指出,大规模蒸馏可能让先进能力在未投入同等安全成本的情况下快速转移,而模型在军民两用领域的能力越强,这一问题就越严重。
在应对措施上,OpenAI表示已封锁或限制相关欺诈账号,强化注册与基础设施管控,并修补一条漏洞:原本持有他人加密推理内容的人,能够重放并还原其内容。若相关活动通过第三方服务进行,OpenAI也与这些服务商合作识别并阻断有关账号。
已向同行与政府渠道通报
OpenAI称,公司已通过前沿模型论坛(Frontier Model Forum)以及政府信息分享渠道,向其他前沿模型开发者和公共部门通报相关活动。
OpenAI还提到,这类操纵手法并不是 OpenAI 模型独有的弱点,独立安全研究人员此前也曾通过负责任披露,报告过相关的跨模型漏洞。
报告发布前几周,Anthropic也曾提出类似指控
根据 CNBC 报道,在 OpenAI 这份报告发布前几周,Anthropic曾指控包括月之暗面、阿里巴巴在内的多家中国 AI 开发商,暗中使用 Claude 协助训练自家模型。ABMedia称,链新闻此前也报道过 Anthropic 阻断中国实验室非法蒸馏 Claude 的经过。
OpenAI预计,随着前沿模型持续进步,蒸馏尝试会变得更精密,防御需要多层管控与持续调整。公司表示,后续将聚焦三个方向:更强的技术防护、更好的协同行动检测与执法,以及更深入的业界与政府威胁情报分享。

