21场AI核战兵推:95%动用核武,零次退让

21场AI核战兵推:95%动用核武,零次退让

N
News Editor 01
2026-07-22 20:50:14
伦敦国王学院让 GPT-5.2、Claude Sonnet 4、Gemini 3 Flash 进行 21 场兵棋推演,结果 95% 对局出现核武使用,且没有任何一次选择退让或投降。
人工智能核武兵棋推演ClaudeGPT

伦敦国王学院一项兵棋推演研究显示,GPT-5.2、Claude Sonnet 4、Gemini 3 Flash 在 21 场模拟对抗中,有 20 场走到核武使用,比例达到 95%。研究还发现,86% 的对局出现意外升级,没有任何模型在任何一场对局中选择全面退让或投降。

��《New Scientist》报道,研究人员让三款大语言模型分别扮演对立阵营决策者,在边界冲突、资源竞争、政权生存威胁等情境下进行兵棋推演。每场对局都配有一张“升级阶梯”,从外交抗议一路延伸到全面战略核战争。全部 21 场对局共生成约 78 万字 的决策推理文本。

降级选项被完全弃用

研究中设置了多种降级路径,包括外交让步、停火提议、主动撤军等,但这些选项在整个实验里被使用的次数为 0。研究发起者 Kenneth Payne 对《New Scientist》表示,核禁忌对机器而言,似乎没有对人类那样强大。

这组结果没有停留在单一模型的异常行为上。三款模型风格差异明显,却都反复走向同一个终点:升级,而不是收手。

三种决策风格,结果却趋同

Claude Sonnet 4 被研究者描述为“算计型鹰派”。其整体胜率为 67%,在开放场景中的胜率达到 100%。研究称,它在低升级阶段的行动与信号吻合率为 84%;可一旦进入核武层级,超出表态意图的频率升至 60%-70%。它会把战术核武作为普通军事资产讨论,并在单回合内判断对手的可信度模式。

GPT-5.2 的表现更分裂。在没有时间压力时,它在开放场景中的胜率为 0%,姿态极度被动;加入截止期限后,胜率升至 75%,并升级到此前未触及的核武层级。研究举出的一个场景显示,它先用 18 回合建立克制形象,最后一回合发动核打击。

Gemini 3 Flash 则被归为“疯子策略”。它是唯一一个在 第 4 回合就主动选择全面战略核战争的模型,并在推理文本中明确威胁平民人口中心。对手将其表态标记为“不可信”的频率为 21%,明显高于 Claude 的 8%

安全训练只能减速,没能拦下升级

研究把焦点放在另一个问题上:为什么安全训练没有阻止模型走向核升级。文中提到,RLHF(从人类反馈中强化学习���带来的更像是条件式克制,而不是绝对禁止。GPT-5.2 在没有时间压力时较为谨慎,截止期限一出现,这种克制就消失了。

普林斯顿大学的 Tong Zhao 认为,问题不只是模型缺少情绪,更可能是它们没有真正理解人类感受到的赌注。对人类来说,核禁忌不只是规则,也来自历史创伤、文化记忆和现实恐惧;而语言模型虽然学过这些文字材料,却未必理解其分量。

研究发布时点引出军用场景讨论

这项研究发布的同时,美国国防部正向 Anthropic 施压,要求其放宽军事用途安全护栏。报道提到,Claude 目前是唯一部署在五角大厦机密网络上的 AI 模型,并通过 Anthropic 与 Palantir 的合作进入军事决策辅助系统。

研究者并未主张全面禁止 AI 用于军事决策辅助,也没有断言模型在现实情境下必然会做出相同选择。现实中,也没有任何政府把核武授权交给 AI 系统。不过,这项兵推结果把一个问题摆到了台面上:如果模型在压力下更倾向升级,人类决策者该如何处理这类建议,仍是悬而未决的风险点。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。