随着世界杯进入淘汰赛阶段,AI 预测从“谁分析得更像那么回事”,进入了更直接的检验阶段:谁能在赛前更接近真实结果。Odaily 星球日报从首场淘汰赛开始,用尽量一致的问题测试多款主流模型,并在赛后逐场回看。参与比较的模型包括 ChatGPT、Grok、千问、DeepSeek、Gemini、Claude,重点不是谁写得更完整,而是谁更值得在预测场景中参考。

从已结束的比赛看,淘汰赛的不确定性非常高。加拿大 1:0 绝杀南非,巴西 2:1 险胜日本,德国被巴拉圭拖进点球大战后出局,荷兰则倒在摩洛哥的点球大战中。比利时对塞内加尔更是踢成 2:2 后在加时出现逆转。这种环境下,模型之间的差异不再只是措辞风格,而是体现在对冷门、比分和比赛路径的判断能力上。
荷兰 vs 摩洛哥:DeepSeek 与 Gemini 最亮眼的一场
在目前的复盘中,最有代表性的比赛是荷兰对摩洛哥。赛前这场并不容易判断,荷兰在纸面实力和阵容完整度上更占优,很多模型虽然承认摩洛哥不好踢,但最终仍更倾向荷兰过关。真正拉开差距的,是谁敢把“比赛很胶着”进一步写成具体剧本。

Gemini 赛前直接给出常规时间 1:1、点球大战摩洛哥胜出的判断。实际结果同样是 1:1,随后摩洛哥在点球大战中以 3:2 淘汰荷兰。它不仅判断对了方向,连比赛如何被拖进点球、最终谁晋级都与现实高度接近。
DeepSeek 的判断也非常接近。它认为常规时间大概率会是 1:1 或 0:0,比赛可能一路拖到加时甚至点球,并倾向摩洛哥依靠防守和反击完成爆冷晋级。相比多数只停留在“荷兰更强但比赛不会轻松”的预测,DeepSeek 和 Gemini 的优势在于,它们把高不确定性场次写成了更完整的结果路径。

Grok 与千问:更像擅长热门局的“比分型选手”
除了冷门场次中的高光,Grok 和千问在热门球队晋级的比赛里表现同样稳定。它们的突出特点不是大胆押注冷门,而是在相对清晰的胜负方向里,把比分落点压得更近。这一点在加拿大对南非、巴西对日本以及科特迪瓦对挪威几场比赛中体现得比较明显。
加拿大对南非一战,赛前多数模型都看好加拿大晋级,但争议在于会不会形成大胜。Grok 给出的判断是加拿大 1:0 取胜,千问 也给出过一球小胜的结论。最终加拿大确实只靠 1 个进球过关,没有打成大比分。这里命中的重点不是“加拿大赢”,而是“赢得有限”。

巴西对日本也是类似。大部分模型都认为巴西实力更强,真正的分歧在于日本能否把比赛咬住。Grok 和千问都给出 2:1 的比分预测,最终结果也正是巴西 2:1 险胜。科特迪瓦对挪威这场,两者同样判断挪威 2:1 获胜,赛果也落在这一范围内。整体来看,Grok 与千问更擅长区分热门球队是“轻松过关”还是“艰难小胜”。
ChatGPT 与 Claude:过程分析更完整,但结论偏保守
与前两类模型相比,ChatGPT 和 Claude 更像“分析型选手”。它们通常不会把比赛直接写成强队碾压,而是更愿意展开阻力来源,比如对手的压迫、跑动、低位防守、边路冲击,以及比赛被拖慢后出现加时风险的可能。这让它们在理解比赛过程时更有参考价值,但在押注最终结果时往往不够激进。
巴西对日本的预测就是例子。ChatGPT 虽然判断巴西晋级,但没有把比赛描述成轻松大胜,而是强调日本的压迫、跑动和纪律性会让巴西踢得很不舒服,甚至可能先丢球或被追平。科特迪瓦对挪威的预测也是类似逻辑:它支持挪威晋级,但同时指出科特迪瓦的身体对抗、边路冲击和转换能力足以制造麻烦。

在英格兰对刚果民主共和国的比赛中,ChatGPT 同样没有简单押英格兰大胜,而是认为比赛节奏可能偏闷,刚果民主共和国会通过低位防守拖住比赛。最终英格兰虽然晋级,但过程并不轻松。这类预测的价值在于,它经常能提前指出比赛阻力在哪里;问题则是,当冷门真正可能发生时,它通常不太愿意把结论明确写到弱势一方。
德国 vs 巴拉圭:多模型集体失准的典型案例
如果说前几场还能看出不同模型各自的强项,那么德国对巴拉圭则是一场“集体翻车”。赛前,几乎所有主流模型都站在德国一边。ChatGPT、Grok、千问、Gemini、Claude 普遍认为德国在纸面实力、阵容深度和进攻火力上全面占优,比分预测也大多集中在 2:0、3:0 或 3:1。

但实际比赛并没有按强弱分明的逻辑推进。巴拉圭成功把比赛拖入消耗战,德国没能在常规时间解决战斗,也没能在加时阶段打破僵局,最终在点球大战中被淘汰。这个案例说明,模型在面对传统强队时仍容易受纸面实力和历史印象影响,低估了对手把比赛拖入极端不确定环境的能力。
不同 AI 适合什么场景,比“谁最懂球”更重要
结合目前已经结束的淘汰赛结果,各模型的标签已经相对清晰。DeepSeek 和 Gemini 的优势,是在高难度比赛中敢于给出更明确的冷门路径,不只判断“会很胶着”,还愿意进一步写出加时、点球甚至爆冷晋级的完整剧本。荷兰对摩洛哥这场,尤其是 Gemini 对“1:1 + 点球摩洛哥胜”的命中,是目前最亮眼的案例。

Grok 和千问 更像高命中率的比分型模型。它们在加拿大、巴西、挪威、法国等热门局中的表现更稳,往往既能判断晋级方向,也能把比分压在更接近真实结果的区间。但遇到德国、荷兰这类传统强队时,仍更容易偏向热门一方。
ChatGPT 和 Claude 则更适合用来理解比赛过程,而不是单看最终比分。它们通常能较早指出强队面临的麻烦、节奏风险和加时可能,但在真正需要对冷门下结论时往往偏保守。换句话说,与其追问哪个模型“最懂球”,不如先分清自己的使用场景:是要抓冷门、压比分,还是拆解比赛会如何发展。原文来源:Odaily 星球日报。

