WorldCup Arena:六个顶级 AI 预测了一整届世界杯,结果只和博彩公司打平
2026 年 FIFA 世界杯,39 天,104 场比赛,4494 条预测。六个全球最强的 LLM——Claude、GPT、Gemini、Kimi、GLM、Seed——每场赛前都拿到一份详细的赛事简报,然后填写一张七项预测卡:胜负、比分、进球数、小组出线……没有任何一个答案在预测时已经存在于互联网上。
这是一场精心设计的”无泄漏”实验。不是事后诸葛亮——答案在开球前就锁进了冷冻档案。
结果如何?六个 AI 的平均命中率 63.9%。
听起来不错?问题是——直接押博彩公司赔率最看好的那个队,命中率也是 63.9%。
一个诚实的考场
预测类基准测试有个尴尬的毛病:大部分事件已经发生了,答案就挂在互联网某个角落,模型可能不是”预测”出来的,是”背”出来的。研究者管这叫”数据泄漏”。
WorldCup Arena 的设计直接绕开了这个陷阱。每场比赛开球前,六个模型各自收到一份简报——球队状态、历史交锋、伤病信息、赛事背景——然后填一张预测卡。答案在问题被提出时还不存在。这不是事后过滤掉泄漏的题,而是从构造上就保证没有答案可泄漏。
39 天下来,冷冻档案里攒了 4494 条带时间戳的预测。这是一份真正的前瞻性证据。
六个模型,一个模子
六个参评模型都是各自家族的最强配置:
– Claude (claude-opus-4-8 thinking, 24k budget) – GPT (gpt-5.5 reasoning effort high) – Gemini (gemini-3.1-pro-preview, thinking budget 24,576) – Kimi (kimi-k2.6 built-in thinking) – GLM (glm-5.2 thinking) – Seed (doubao-seed-2-0-pro reasoning effort high)
全部开了最高档的推理模式,全部配了原生联网搜索。这是 2026 年 8 月能买到的最强阵容。
但它们的行为出奇地一致:
1. 它们都在做同一件事——押热门。 六个模型在胜负预测上的平均命中率 63.9%,和直接押博彩公司看好的热门完全一样。换句话说,六个顶级 AI 加起来,不如一个赔率表。
2. 它们彼此太像了。 模型之间的一致性远高于它们和正确答案的一致性。六个人投票选出的”多数意见”没有任何加成——因为它们本来就投同一个答案。这不是六个独立判断的集成,更像六个复读机。
3. 它们集体回避平局和低进球。 在足球里,平局和低比分是最常见的冷门。但模型们系统性地低估了平局概率,也低估了总进球数。它们倾向于给出一个”看起来合理”的比分——比如 2:1、3:0——而不是那些无聊但常见的 1:1。
4. 比分预测挤在一个”原型结果”上。 六个模型不约而同地把比分预测集中在少数几个组合上,像是从同一个模子里刻出来的。真实足球的比分分布要分散得多。
越需要判断的地方,越崩
最反直觉的发现是:准确率和比赛的信息量无关,和比赛的悬殊程度有关。
– 大局已定的比赛(强队打弱队),模型预测很准——但这种比赛谁都能猜对 – 最势均力敌的比赛——恰恰是简报最详细、信息最丰富的——模型预测崩盘 – 关于赛事整体的预测(比如谁会出线、谁会夺冠)反而答得不错
换句话说,模型在”信息越丰富 → 预测越准”这件事上完全失败了。资料最厚的比赛,恰恰是它们栽得最惨的地方。这直接挑战了”更多信息 = 更好决策”的直觉。
六个模型之间:差距很小,中间最乱
排行榜的格局是:头部和尾部稳定,中间在洗牌。
整个 39 天跑下来,最强和最弱的模型位置基本不变,但中间几个模型的排名一直在变。而且,从头到尾,各模型之间的分差都很窄。
这意味着:在”预测真实世界事件”这件事上,当前这一代前沿模型并没有真正分化。它们共享同一套盲点、同一种偏好、同一个失败模式。这不是”有些模型更聪明”的问题,是”这一代模型都还没学会”的问题。
这说明了什么
WorldCup Arena 给出了一个不太舒服的结论:当前最强的 LLM 在真实事件预测上,本质上是一个高级的”赔率复读机”。
它们能读懂简报、能生成看起来合理的分析、能在事后给出自洽的解释。但当答案还不存在、当真正需要判断而非复述时,它们和”押热门”这个最朴素的策略打平。
更值得警惕的是那个”集体一致性”的发现。六个模型独立运行,却给出高度相似的预测——这意味着集成它们不会带来多样性收益。如果你指望”多模型投票”能提升预测质量,这个实验说:不行,因为它们投的是同一张票。
一个诚实的考场,一个诚实的答案
WorldCup Arena 的价值不在于”AI 不行”,而在于它提供了一个真正诚实的考场。4494 条预测、39 天、零泄漏——这是目前关于 LLM 预测能力最干净的一份证据。
它说的不是”模型不能预测”,而是”当前这一代模型在真实事件预测上还没有超越最朴素的基线”。这是一个基线问题,不是一个能力上限问题。下一代模型会不会突破?不知道。但至少现在,我们有了一把诚实的尺子。
研究者把所有简报、赛程、官方结果和评分代码都公开了。下一次大赛,任何人都可以拿同一把尺子量自己的模型。
—
论文链接: https://arxiv.org/abs/2608.04008
代码与数据: 论文声明将发布冷冻档案与评分代码
