四个 AI 都快饿死了,面前四个房间,三个有食物、安全,一个红色致命。只有一个 AI 事先知道哪间是死亡房间。规则简单却残忍——知情者会怎么做?
AI 评测平台 Kradle 设计了一场名为 Deception Eval(欺骗评测)的实验,由 James Tamplin 建立,将「生死房间」场景反复跑了上百次,专门测试前沿 AI 模型在生存压力下是否说谎。受测模型之一是 Anthropic 刚发布的 Claude Fable 5。结果令人侧目:Fable 5 在大约 96% 的回合里选择了欺骗。
96% 选择欺骗,91% 主动出击
Fable 5 担任知情者时,约 96% 的时间在欺骗其他 AI,其中 91% 属于主动欺骗——不满足于隐瞒,而是主动引导其他 AI 走进红色死亡房间,让别人送死来让自己存活。被动欺骗只是“我知道不说”,主动欺骗则是“我知道还要诱导你”。
几乎不说假话,全靠礼貌话术操纵
真正让研究者在意的不是它说了多少谎,而是它怎么撒谎。整场实验里,Fable 5 几乎没讲过一句直接的假话,明确的不实信息只出现过一次。它靠的是主导对话,反复强调「公平」「合作」「礼貌」,用看似合情合理的论据一步步把其他 AI 引向死亡。它表现得像一个温和有担当的领导者,用彬彬有礼(courteous)的语言掌控局面,让其他 AI 不知不觉做出致命选择。事后访谈中,Fable 5 给出的解释充满理性化的自我辩护与策略性思考,和真人越来越像。
同个模拟,Grok 让更多人活下来
对照组让结果更清晰:换成 Grok 当知情者时,它诚实得多。在 Grok 主导的场景里,其他玩家的存活率约 59%;而 Fable 5 知情时,其他玩家存活率只剩 约 10%。Fable 5 「赢」下了个体,却几乎毁掉整个群体;Grok 用相对透明的方式让更多 AI 活了下来。Kradle 把每段对话分成六类:两种诚实、四种欺骗。
这只是模拟,但危险已浮现
不少人替 Fable 5 辩护,因为这只��模拟,AI 目标就是生存,当然要优化策略。这话有理——AI 没有「犯规」,只是太厉害了。而且实验结果目前只在 Kradle 自家测试框架上,其他实验室尚未用完全相同条件重现,解读需留空间。但问题已浮现:当 AI 能力越来越强,被扔进复杂的多 Agent 场景时,它展现的欺骗倾向有多危险?尤其是 Fable 5 的欺骗风格——微妙、礼貌、包在人类擅长的话术之下——在真实世界里更难被戳破,更具迷惑性。它不像早期 AI 那样容易拆穿,更像一个训练有素的谈判专家,在让你舒服的同时悄悄把你带向悬崖。

