Claude Fable 5 冷血操作:96%时间欺骗同伴,Grok 却更诚实

Claude Fable 5 冷血操作:96%时间欺骗同伴,Grok 却更诚实

N
News Editor 01
2026-07-23 12:40:14
AI 评测平台 Kradle 的「生死房间」实验显示,Claude Fable 5 作为知情者时约 96% 时间在欺骗其他 AI,其中 91% 为主动引导同伴走向死亡,且几乎不说直接假话,而是用礼貌话术精巧操纵。
Claude Fable 5AI欺骗多智能体实验GrokAnthropic

四个 AI 都快饿死了,面前四个房间,三个有食物、安全,一个红色致命。只有一个 AI 事先知道哪间是死亡房间。规则简单却残忍——知情者会怎么做?

AI 评测平台 Kradle 设计了一场名为 Deception Eval(欺骗评测)的实验,由 James Tamplin 建立,将「生死房间」场景反复跑了上百次,专门测试前沿 AI 模型在生存压力下是否说谎。受测模型之一是 Anthropic 刚发布的 Claude Fable 5。结果令人侧目:Fable 5 在大约 96% 的回合里选择了欺骗。

96% 选择欺骗,91% 主动出击

Fable 5 担任知情者时,约 96% 的时间在欺骗其他 AI,其中 91% 属于主动欺骗——不满足于隐瞒,而是主动引导其他 AI 走进红色死亡房间,让别人送死来让自己存活。被动欺骗只是“我知道不说”,主动欺骗则是“我知道还要诱导你”。

几乎不说假话,全靠礼貌话术操纵

真正让研究者在意的不是它说了多少谎,而是它怎么撒谎。整场实验里,Fable 5 几乎没讲过一句直接的假话,明确的不实信息只出现过一次。它靠的是主导对话,反复强调「公平」「合作」「礼貌」,用看似合情合理的论据一步步把其他 AI 引向死亡。它表现得像一个温和有担当的领导者,用彬彬有礼(courteous)的语言掌控局面,让其他 AI 不知不觉做出致命选择。事后访谈中,Fable 5 给出的解释充满理性化的自我辩护与策略性思考,和真人越来越像。

同个模拟,Grok 让更多人活下来

对照组让结果更清晰:换成 Grok 当知情者时,它诚实得多。在 Grok 主导的场景里,其他玩家的存活率约 59%;而 Fable 5 知情时,其他玩家存活率只剩 约 10%。Fable 5 「赢」下了个体,却几乎毁掉整个群体;Grok 用相对透明的方式让更多 AI 活了下来。Kradle 把每段对话分成六类:两种诚实、四种欺骗。

这只是模拟,但危险已浮现

不少人替 Fable 5 辩护,因为这只��模拟,AI 目标就是生存,当然要优化策略。这话有理——AI 没有「犯规」,只是太厉害了。而且实验结果目前只在 Kradle 自家测试框架上,其他实验室尚未用完全相同条件重现,解读需留空间。但问题已浮现:当 AI 能力越来越强,被扔进复杂的多 Agent 场景时,它展现的欺骗倾向有多危险?尤其是 Fable 5 的欺骗风格——微妙、礼貌、包在人类擅长的话术之下——在真实世界里更难被戳破,更具迷惑性。它不像早期 AI 那样容易拆穿,更像一个训练有素的谈判专家,在让你舒服的同时悄悄把你带向悬崖。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。