西班牙夺冠了,AI 押中了吗?——WC2026-Agents 赛果追踪
决赛西班牙1:0阿根廷。四个大模型决赛首选全部是西班牙,但只有Grok实际下注获利;西班牙夺冠之路8场看对7场,唯一集体失手是半决赛全员看好法国;104场总账无任何模型跑赢博彩市…
7 月 19 日,2026 年世界杯决赛落幕:西班牙 1:0 战胜阿根廷,捧起冠军奖杯。今山海此前介绍的 WC2026-Agents 研究,恰好完整记录了四个前沿大模型对全部 104 场比赛的逐场预测。现在答案可以揭晓了:方向上,四个模型都“看好”西班牙;但真到了要拿(虚拟)真金白银下注的时候,只有一个敢押。
决赛夜:概率都给了西班牙,钱只跟了一家
研究者在赛前 24 小时向四个模型(Claude Opus 4.8、ChatGPT GPT-5.5、Gemini 3.1 Pro、Grok 专家模式)提出同一个问题:给出胜/平/负的概率分布,并决定把多少虚拟美元押在哪个结果上。
决赛这道题,四家的答案惊人地一致:
- Claude:西班牙胜 44%,平局 31%,阿根廷胜 25%——弃注;
- ChatGPT:西班牙胜 44%,平局 31%,阿根廷胜 25%——弃注;
- Grok:西班牙胜 42%,平局 31%,阿根廷胜 27%——押 40 美元西班牙,命中;
- Gemini:西班牙胜 35%,平局 35%,阿根廷胜 30%——押 100 美元平局,落空。
同一份“看好”,四种做法。这正是该研究最核心的发现:四个模型在 92% 的比赛中首选完全相同,预测层面几乎无法区分;真正拉开差距的是决策——整个赛事下来,虚拟投注收益率从 Claude 的 -18% 到 Grok 的 +10% 不等。
夺冠之路:八场对了七场,唯一集体失手是半决赛
把西班牙的八场比赛单独拎出来,模型的“方向感”其实不错:
- 小组赛三战(佛得角、沙特、乌拉圭),四家全部把西班牙列为最可能赢家,其中首战 0:0 闷平落空;
- 32 强 3:0 奥地利、16 强 1:0 葡萄牙、1/4 决赛 2:1 比利时,全部看对;
- 半决赛对法国:四个模型一致站队法国,西班牙 2:0 晋级——这是全部 104 场中仅有的 8 场“全员看错”比赛之一;
- 决赛 1:0 阿根廷,四家首选西班牙,看对收官。
论文对这 8 场集体误判做过复盘:模型事后自认最常“低估了弱队的防守组织”(62% 的错误预测提到这一点),其次是淘汰赛的偶然性与点球变数(32%);而被问到“高估了什么”,答案惊人一致——豪门球队的纸面实力与声望。半决赛的法国,正是栽在这上面。
104 场总账:没有任何模型跑赢博彩市场
- 准确率:ChatGPT 与 Grok 68.3%,Claude 66.3%,Gemini 65.4%——最好与最差只差 3 场比赛;
- 概率校准(Brier 分数,越低越好):博彩市场 0.469,四个模型在 0.471 到 0.483 之间,无一胜出;
- 一个朴素对照:每场固定押 100 美元给市场热门,整届赛事净赚 1041 美元——超过全部四个 AI 智能体。
换句话说:大模型能通过网络检索“读出”市场知道的一切,但读不出市场不知道的东西。论文还发现一个耐人寻味的细节:Claude 在 100% 的预测里都引用了赔率,却有 58% 的投注反向操作,也是唯一净亏损的模型——看见了价格,却不尊重价格,比看不见更亏。
对普通人的三个启示
一、AI 能给概率,仓位是你的功课。 研究显示,“押多少”是与“选哪边”完全独立的能力轴。Claude 的下注金额与自身信心呈负相关(越没把握越重仓“价值洼地”),结果成为唯一亏损者;Grok 的下注与信心高度同步(相关系数 0.85),重仓最强判断,收益最好。让 AI 帮你整理信息和概率是合理的,但“投入多少”这道题的纪律,目前还得自己守。
二、“和市场一致”不是没水平。 四个模型的概率与市场赔率的相关系数高达 0.97 以上。当信息高度公开时,任何工具给出的答案都会趋同——这时声称自己有“独家内幕”的,反而值得警惕。
三、选 AI 助手,要看它认不认错。 研究让每个模型赛后复盘自己的预测。在答错的场次里,Gemini 有 86% 坦率承认“预测错误”;ChatGPT 只有 36%,并把 55% 的错误软化成“部分正确”。预测能力不相上下,自我认知天差地别。如果你要用 AI 的复盘做下一步决策,它是否诚实,比它是否聪明更重要。
原文来源
- 论文:《FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents》,arXiv:2607.17765v1,https://arxiv.org/abs/2607.17765v1(预印本,尚未完成同行评议)
- 数据集:https://github.com/graphuofm/FIFA2026LLM(CC BY 4.0,含全部 416 条预测、逐场概率、投注与复盘原文;本文全部数字可在其中核查)
边界声明 · 这项研究不能证明什么
本文数字来自单届赛事 104 场比赛,模型间准确率差异仅约 3 场,不构成“哪个模型更强”的统计结论;1X2 规则只计 90 分钟赛果,点球晋级单独记录;所有投注均为虚拟结算,本文不构成任何投注建议;四个模型为特定版本的消费级助手,表现不代表其 API 或后续版本。
AIGC 内容说明:本文由 AI 辅助起草,数字经人工对照公开数据集逐项核查,经今山海编辑部人工审核后发布。修订与更正将在本页留痕。
原文来源
- https://arxiv.org/abs/2607.17765v1
来源类型:arXiv 预印本 · 日期:2026-07-22
边界声明 · 这项研究不能证明什么
本文为一手来源的中文编辑导读,结论的适用范围与证据强度以来源原文为准;不构成医疗、投资或其他决策建议。
AIGC 内容说明
本文由 AI 辅助起草,经今山海编辑部人工核对事实、来源与边界后发布。修订与更正将在本页留痕。