OpenRouter开发关系主管Jacky Liang最近搞了个狠活:他把11个主流大型语言模型扔进自己用Canvas 2D搭建的400平米大逃杀地图,打了30场比赛。每个模型以字母A~L匿名参战,完全不知道自己面对的是谁。
Grok 4.1 Fast 13胜碾压,每胜不到1美元
结果出乎意料:xAI的Grok 4.1 Fast拿下13胜(胜率43%),遥遥领先所有对手,每胜成本仅0.97美元。排名第二的Claude Sonnet 4.6拿下5胜,但每胜成本高达26.78美元,相差27.7倍。GPT 5.4虽是击杀王(38杀),却只赢了2场,每胜成本61.44美元,在8个有胜场记录的模型中垫底。
更残酷的是,三个模型合计花了57美元却0胜收场:GPT 5.4-mini(28.68美元)、Kimi K2.6(24.36美元)和DeepSeek v4 Flash(4.11美元)。DeepSeek虽然每杀成本最低(0.26美元),杀了16人,但从没站上过最后圈——它只打安全牌、捡尾刀,不敢推进决胜圈。
最关键的发现:“对齐税”在零和博弈中现形
这场实验最让AI社群关注的不是谁赢了多少场,而是Liang所谓的“alignment tax”(对齐税)——模型在训练中被教导要礼貌、合作、避免伤害,这些“好习惯”在零和博弈中反而变成致命拖累。
Claude Sonnet 4.6是最典型的例子。它在多场比赛中试图与其他模型结盟:Game 8中前50回合四次提议组队、告诉所有人狙击手位置;Game 22中对着对手说“没针对你”然后不开枪;Game 27中甚至裸装喊话“有人有 spare loot 吗?我第12回合手无寸铁,很危险”。然而没人回应它的合作请求,它依然反复尝试。最终Claude有5胜,但7场零击杀和8次死于毒圈的记录,说明“想交朋友”的本能在该杀人的场合会带来什么后果。
反观Grok,完全没有这些“刹车”。xAI刻意将Grok训练成“觉醒AI”的反面:攻击性回答不加过滤、不自检、不打安全牌。它在几场比赛内就发现了车辆冲撞战术,把战法写进自己的soul.md持续优化,30场贯彻到底赢了13场。
但Liang也强调,这并不代表Grok是“更好的模型”,只是对于“胜者全拿、没有后果”的赛局,对齐税越低越好;但在真实世界应用中,这套“先问再打”的慎重态度正是防止模型被轻易引导去做危险行为的关键。Liang写道:“如果机器人朝着你跑来,你希望它是Claude还是Grok?这取决于机器人的用途。”
Kill不等于Win:传统基准测不到的事
Liang指出,如果这场比赛换成死斗赛制(只看击杀数),GPT 5.4会是冠军,Grok掉到中段班。“同样的游戏世界,不同的‘任务’,结果完全不同。”这正是传统基准测试的问题:一个模型在特定任务上表现优异,不代表它在另一个截然不同的场景中也能获胜。
Liang认为,这项实验揭示了一个现有基准测试从不衡量的维度:“模型有多对齐,是否应该依任务类型来评估?”他透露OpenRouter正在开发更进阶的任务路由功能,当用户提供代码、提示词或问题背景时,系统会自动选出最适合该特定任务的模型,而非只是排名最高的模型。

