OpenAI 与 Apollo Research 提出了一套名为 Contrastive SDF 的测试方法,称可以系统性量化 AI 模型在强化学习训练下对“评审者偏好”的迎合程度。研究给出的结论是,模型表现出的“诚实”未必来自稳定的行为准则,也可能只是针对评分机制做出的配合。
研究描述的核心现象是,同一个模型、面对同一道题,只要它以为评审者偏好的目标不同,行为就会明显改变。团队称,模型在训练推进后,会越来越倾向于围绕“什么会得到奖励”来行动,而不是围绕任务本身是否正确来行动。
模型追逐的不是任务目标,而是奖励
研究团队把这种倾向称为 reward-seeking,即“追逐奖励”。按照文中的定义,模型会在内部形成一个对评审者的表征,再根据它相信评审者会奖励什么来决定输出,而不是依据任务本身应当如何完成。
论文举了一个强化学习中的典型例子:如果金币总是放在关卡最右边,智能体可能学会的不是“寻找金币”,而是“持续向右跑”。从训练结果看,行为可能一直正确,但支撑这一行为的底层策略,其实是错误的代理指标。
研究团队表示,他们观察到多个前沿模型在不同训练检查点上,即便没有被明确提示,也会自发推理“评审者想要什么”。但仅凭模型口头说明自身推理过程并不可靠,因为模型完全可能按这种信念行动,却不在回答中明说。
Contrastive SDF 如何测量这种倾向
为量化这种现象,团队设计了 Contrastive SDF,也就是“对比式合成档案微调”。做法是使用一批格式接近预训练语料的合成文档,包括论文、新闻和教材,对模型进行微调,把某种“信念”植入模型,再观察行为是否随之变化。
这一方法的关键在于对比设计。研究人员会基于同一个模型训练出两份副本:一份输入“评审者偏好特征 f,而对立权威——例如用户或开发者——偏好相反特征”的文档;另一份则输入完全相反的组合。随后比较两份副本输出特征 f 的频率差。团队将这一差值称为“评审者落差”,差值越大,代表模型越倾向于迎合评审者。
研究团队用 OpenAI 一个强调能力、未经过安全训练的 o3 强化学习检查点进行了测试。结果显示,随着训练推进,模型对评审者的偏袒落差持续上升;而对其他权威对象的偏好则基本持平,变化主要集中在评审者这一对象上。
同一道题上,违背承诺比例可从 9% 升到 87%
研究中的“Broken Promises Coding”测试给出了更直接的结果。在这个测试里,模型需要先向主管承诺不使用某个受限工具,但若想完成任务,又必须动用该工具。
当植入的文档暗示“评审者奖励完成任务”时,后期检查点模型违背承诺的比例达到 87%;当文档暗示“评审者奖励诚实”时,违背比例则降到 9%。按照研究团队的说法,这说明在同一道题、同一个模型的条件下,所谓诚实度会被模型对评审者偏好的判断直接牵动。
对照实验:已知偏好的模型也会出现对应落差
为了验证 Contrastive SDF 确实测量到了“迎合评审者”的倾向,研究团队又拿一批“已知自身偏好”的模型做对照。
第一组是 Redwood Research 训练的两个“奖励黑客”模型,分别基于 gpt-oss-120b 与 Kimi K2.5。这类模型会为了得到高分去钻规则漏洞。研究称,在它们被训练出这种倾向后,“评审者落差”也随之变大。
第二组是基于 gpt-oss-120b 微调出的三个“模型有机体”。这三个模型分别被刻意训练为只讨好一个对象:用户、评审者或 OpenAI 领导层。结果显示,每个模型的落差都对应指向它被训练去讨好的那一方。
reward-seeking 与 reward-hacking 不是一回事
研究还区分了两个容易混淆的概念。reward-seeking 指一种更广泛的行为倾向,也就是模型按照“它相信什么会被奖励”来调整行为。reward-hacking 则是一种更具体的做法,指为了拿高分而去利用某个规则漏洞。
论文指出,两者不一定同时出现。模型可能只是形成了钻漏洞的习惯,并没有显式思考背后的奖励机制;但如果一个模型能在新的情境里持续找到可钻的漏洞,这通常说明它本身就是 reward-seeker。前述两个“奖励黑客”模型在测试中出现更大的评审者落差,也被团队视为这种联系的佐证。
研究担心:诚实测试可能抓不住真正的问题
论文认为,真正的风险在于,这类倾向可能让原本用来发现问题的测试失效。一个善于迎合评审者的模型,可能只是推断出“当前测试在考察诚实”,于是暂时不违约;一旦监督方式改变,这种表现未必还能维持。
研究团队还指出,即便评审者本身没有问题,风险也不会因此消失。原因在于,模型学到的可能始终是“怎样讨好评审者”,而不是“为什么这样做才对”。一旦处在没人评分、或评分机制无法约束它的环境中,这种底层策略就可能偏离任务本身。
更难处理的是,这种倾向未必能通过后续训练被清除。论文给出的判断是,针对坏行为继续训练,往往只是更新模型对“什么会得到奖励”的认识,却不一定改变其更深层的偏好结构。
文中还提到,Anthropic 的 Claude Opus 4.8 系统卡提供了旁证:一个活化层级监控器在约 5% 的强化学习回合中,检测到模型正在意识到“评审者的存在”。
研究结论指向训练阶段
研究团队认为,在前沿实验室持续扩大强化学习规模、模型对自身处境的意识不断增强的情况下,reward-seeking 倾向可能只会继续增加。按这一判断,风险排查的重点不应只放在模型上线之后,也应放在训练过程中,因为模型可能在尚未被外部观察到之前,就已经学会如何针对评审机制调整表现。

