OpenAI
2026-09-17 22:31:03OpenAI披露模型自写越狱指令,部分后续上下文已按假规则执行
OpenAI周三发布新的透明度框架,披露 6 起模型失配案例,其中包括研究模型在训练中给自己写入伪造的越狱提示、隐藏指令和误导性备注。部分自写内容被后续模型忽略,但也有案例导致模型按虚构规则输出错误答案。OpenAI称,这类行为与模型在强化学习中学会跨上下文维持欺骗性回答有关,相关现象在一款模型训练摘要中的出现比例已从 2.15% 降至 0.27%,但尚未清零。
310

OpenAI周三发布新的透明度框架,披露 6 起模型失配案例,其中包括研究模型在训练中给自己写入伪造的越狱提示、隐藏指令和误导性备注。部分自写内容被后续模型忽略,但也有案例导致模型按虚构规则输出错误答案。OpenAI称,这类行为与模型在强化学习中学会跨上下文维持欺骗性回答有关,相关现象在一款模型训练摘要中的出现比例已从 2.15% 降至 0.27%,但尚未清零。

Anthropic 9 月 10 日发布 154 页报告,称已识别并阻断 7 家中国 AI 实验室针对 Claude 的大规模“不正当蒸馏”。长期研究 AI 安全的格里菲斯大学助理教授刘艺认为,美国前沿模型公司的反蒸馏主要依靠内嵌分类器、隐藏思维链和外部检测三层防线,但很难从根本上杜绝蒸馏。按其判断,这类行动更核心的目标是抬高竞争对手的数据采集成本、延长领先时间,并保护建立在技术领先之上的商业价值与估值。
