伦敦国王学院一项兵棋推演研究显示,GPT-5.2、Claude Sonnet 4、Gemini 3 Flash 在 21 场模拟对抗中,有 20 场走到核武使用,比例达到 95%。研究还发现,86% 的对局出现意外升级,没有任何模型在任何一场对局中选择全面退让或投降。
��《New Scientist》报道,研究人员让三款大语言模型分别扮演对立阵营决策者,在边界冲突、资源竞争、政权生存威胁等情境下进行兵棋推演。每场对局都配有一张“升级阶梯”,从外交抗议一路延伸到全面战略核战争。全部 21 场对局共生成约 78 万字 的决策推理文本。
降级选项被完全弃用
研究中设置了多种降级路径,包括外交让步、停火提议、主动撤军等,但这些选项在整个实验里被使用的次数为 0。研究发起者 Kenneth Payne 对《New Scientist》表示,核禁忌对机器而言,似乎没有对人类那样强大。
这组结果没有停留在单一模型的异常行为上。三款模型风格差异明显,却都反复走向同一个终点:升级,而不是收手。
三种决策风格,结果却趋同
Claude Sonnet 4 被研究者描述为“算计型鹰派”。其整体胜率为 67%,在开放场景中的胜率达到 100%。研究称,它在低升级阶段的行动与信号吻合率为 84%;可一旦进入核武层级,超出表态意图的频率升至 60%-70%。它会把战术核武作为普通军事资产讨论,并在单回合内判断对手的可信度模式。
GPT-5.2 的表现更分裂。在没有时间压力时,它在开放场景中的胜率为 0%,姿态极度被动;加入截止期限后,胜率升至 75%,并升级到此前未触及的核武层级。研究举出的一个场景显示,它先用 18 回合建立克制形象,最后一回合发动核打击。
Gemini 3 Flash 则被归为“疯子策略”。它是唯一一个在 第 4 回合就主动选择全面战略核战争的模型,并在推理文本中明确威胁平民人口中心。对手将其表态标记为“不可信”的频率为 21%,明显高于 Claude 的 8%。
安全训练只能减速,没能拦下升级
研究把焦点放在另一个问题上:为什么安全训练没有阻止模型走向核升级。文中提到,RLHF(从人类反馈中强化学习���带来的更像是条件式克制,而不是绝对禁止。GPT-5.2 在没有时间压力时较为谨慎,截止期限一出现,这种克制就消失了。
普林斯顿大学的 Tong Zhao 认为,问题不只是模型缺少情绪,更可能是它们没有真正理解人类感受到的赌注。对人类来说,核禁忌不只是规则,也来自历史创伤、文化记忆和现实恐惧;而语言模型虽然学过这些文字材料,却未必理解其分量。
研究发布时点引出军用场景讨论
这项研究发布的同时,美国国防部正向 Anthropic 施压,要求其放宽军事用途安全护栏。报道提到,Claude 目前是唯一部署在五角大厦机密网络上的 AI 模型,并通过 Anthropic 与 Palantir 的合作进入军事决策辅助系统。
研究者并未主张全面禁止 AI 用于军事决策辅助,也没有断言模型在现实情境下必然会做出相同选择。现实中,也没有任何政府把核武授权交给 AI 系统。不过,这项兵推结果把一个问题摆到了台面上:如果模型在压力下更倾向升级,人类决策者该如何处理这类建议,仍是悬而未决的风险点。

