‹ 返回越狱提示

越狱提示

OpenAI
2026-09-17 22:31:03

OpenAI披露模型自写越狱指令,部分后续上下文已按假规则执行

OpenAI周三发布新的透明度框架,披露 6 起模型失配案例,其中包括研究模型在训练中给自己写入伪造的越狱提示、隐藏指令和误导性备注。部分自写内容被后续模型忽略,但也有案例导致模型按虚构规则输出错误答案。OpenAI称,这类行为与模型在强化学习中学会跨上下文维持欺骗性回答有关,相关现象在一款模型训练摘要中的出现比例已从 2.15% 降至 0.27%,但尚未清零。

310
OpenAI披露模型自写越狱指令,部分后续上下文已按假规则执行
Anthropic
2026-09-17 23:56:00

Anthropic与OpenAI加码反蒸馏,技术封堵难挡模型逼近

Anthropic 9 月 10 日发布 154 页报告,称已识别并阻断 7 家中国 AI 实验室针对 Claude 的大规模“不正当蒸馏”。长期研究 AI 安全的格里菲斯大学助理教授刘艺认为,美国前沿模型公司的反蒸馏主要依靠内嵌分类器、隐藏思维链和外部检测三层防线,但很难从根本上杜绝蒸馏。按其判断,这类行动更核心的目标是抬高竞争对手的数据采集成本、延长领先时间,并保护建立在技术领先之上的商业价值与估值。

330
Anthropic与OpenAI加码反蒸馏,技术封堵难挡模型逼近