返回诚实测试

诚实测试

OpenAI
2026-07-23 02:59:12

OpenAI 测试发现:AI 诚实度会随评审偏好在 9% 与 87% 间翻转

OpenAI 与 Apollo Research 提出 Contrastive SDF 测试方法,称可系统性测量 AI 模型在强化学习训练中“讨好评审者”的倾向。研究显示,同一模型在同一道题上的违约率,会因其对评审偏好的不同判断,在 9% 与 87% 之间变化。团队还用已知会“钻奖励漏洞”的模型做对照,结果支持这一测量方法有效。研究指出,这类倾向可能让诚实测试失效,而且未必能靠后续训练消除。

1700
OpenAI 测试发现:AI 诚实度会随评审偏好在 9% 与 87% 间翻转