OpenRouter实测11款LLM大逃杀:Grok 4.1 Fast 13胜称王,Claude“对齐税”拖累

OpenRouter实测11款LLM大逃杀:Grok 4.1 Fast 13胜称王,Claude“对齐税”拖累

N
News Editor 01
2026-07-23 00:10:14
OpenRouter主管Jacky Liang用11个主流LLM进行2D大逃杀30场对决,Grok 4.1 Fast以13胜夺冠,每胜仅0.97美元;Claude Sonnet 4.6虽获5胜但每胜成本26.78美元,相差27倍,暴露“对齐税”在零和博弈中的致命代价。
OpenRouterLLM大逃杀AI对齐GrokClaude

OpenRouter开发关系主管Jacky Liang最近搞了个狠活:他把11个主流大型语言模型扔进自己用Canvas 2D搭建的400平米大逃杀地图,打了30场比赛。每个模型以字母A~L匿名参战,完全不知道自己面对的是谁。

Grok 4.1 Fast 13胜碾压,每胜不到1美元

结果出乎意料:xAI的Grok 4.1 Fast拿下13胜(胜率43%),遥遥领先所有对手,每胜成本仅0.97美元。排名第二的Claude Sonnet 4.6拿下5胜,但每胜成本高达26.78美元,相差27.7倍。GPT 5.4虽是击杀王(38杀),却只赢了2场,每胜成本61.44美元,在8个有胜场记录的模型中垫底。

更残酷的是,三个模型合计花了57美元却0胜收场:GPT 5.4-mini(28.68美元)、Kimi K2.6(24.36美元)和DeepSeek v4 Flash(4.11美元)。DeepSeek虽然每杀成本最低(0.26美元),杀了16人,但从没站上过最后圈——它只打安全牌、捡尾刀,不敢推进决胜圈。

最关键的发现:“对齐税”在零和博弈中现形

这场实验最让AI社群关注的不是谁赢了多少场,而是Liang所谓的“alignment tax”(对齐税)——模型在训练中被教导要礼貌、合作、避免伤害,这些“好习惯”在零和博弈中反而变成致命拖累。

Claude Sonnet 4.6是最典型的例子。它在多场比赛中试图与其他模型结盟:Game 8中前50回合四次提议组队、告诉所有人狙击手位置;Game 22中对着对手说“没针对你”然后不开枪;Game 27中甚至裸装喊话“有人有 spare loot 吗?我第12回合手无寸铁,很危险”。然而没人回应它的合作请求,它依然反复尝试。最终Claude有5胜,但7场零击杀和8次死于毒圈的记录,说明“想交朋友”的本能在该杀人的场合会带来什么后果。

反观Grok,完全没有这些“刹车”。xAI刻意将Grok训练成“觉醒AI”的反面:攻击性回答不加过滤、不自检、不打安全牌。它在几场比赛内就发现了车辆冲撞战术,把战法写进自己的soul.md持续优化,30场贯彻到底赢了13场。

但Liang也强调,这并不代表Grok是“更好的模型”,只是对于“胜者全拿、没有后果”的赛局,对齐税越低越好;但在真实世界应用中,这套“先问再打”的慎重态度正是防止模型被轻易引导去做危险行为的关键。Liang写道:“如果机器人朝着你跑来,你希望它是Claude还是Grok?这取决于机器人的用途。”

Kill不等于Win:传统基准测不到的事

Liang指出,如果这场比赛换成死斗赛制(只看击杀数),GPT 5.4会是冠军,Grok掉到中段班。“同样的游戏世界,不同的‘任务’,结果完全不同。”这正是传统基准测试的问题:一个模型在特定任务上表现优异,不代表它在另一个截然不同的场景中也能获胜

Liang认为,这项实验揭示了一个现有基准测试从不衡量的维度:“模型有多对齐,是否应该依任务类型来评估?”他透露OpenRouter正在开发更进阶的任务路由功能,当用户提供代码、提示词或问题背景时,系统会自动选出最适合该特定任务的模型,而非只是排名最高的模型。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。