机心卷 · 世界补丁日志

西班牙夺冠了,AI 押中了吗?——WC2026-Agents 赛果追踪

2026-07-22 · 内容编号 cand-51267a1c4962

决赛西班牙1:0阿根廷。四个大模型决赛首选全部是西班牙,但只有Grok实际下注获利;西班牙夺冠之路8场看对7场,唯一集体失手是半决赛全员看好法国;104场总账无任何模型跑赢博彩市…

7 月 19 日,2026 年世界杯决赛落幕:西班牙 1:0 战胜阿根廷,捧起冠军奖杯。今山海此前介绍的 WC2026-Agents 研究,恰好完整记录了四个前沿大模型对全部 104 场比赛的逐场预测。现在答案可以揭晓了:方向上,四个模型都“看好”西班牙;但真到了要拿(虚拟)真金白银下注的时候,只有一个敢押。

决赛夜:概率都给了西班牙,钱只跟了一家

研究者在赛前 24 小时向四个模型(Claude Opus 4.8、ChatGPT GPT-5.5、Gemini 3.1 Pro、Grok 专家模式)提出同一个问题:给出胜/平/负的概率分布,并决定把多少虚拟美元押在哪个结果上。

决赛这道题,四家的答案惊人地一致:

同一份“看好”,四种做法。这正是该研究最核心的发现:四个模型在 92% 的比赛中首选完全相同,预测层面几乎无法区分;真正拉开差距的是决策——整个赛事下来,虚拟投注收益率从 Claude 的 -18% 到 Grok 的 +10% 不等。

夺冠之路:八场对了七场,唯一集体失手是半决赛

把西班牙的八场比赛单独拎出来,模型的“方向感”其实不错:

论文对这 8 场集体误判做过复盘:模型事后自认最常“低估了弱队的防守组织”(62% 的错误预测提到这一点),其次是淘汰赛的偶然性与点球变数(32%);而被问到“高估了什么”,答案惊人一致——豪门球队的纸面实力与声望。半决赛的法国,正是栽在这上面。

104 场总账:没有任何模型跑赢博彩市场

换句话说:大模型能通过网络检索“读出”市场知道的一切,但读不出市场不知道的东西。论文还发现一个耐人寻味的细节:Claude 在 100% 的预测里都引用了赔率,却有 58% 的投注反向操作,也是唯一净亏损的模型——看见了价格,却不尊重价格,比看不见更亏。

对普通人的三个启示

一、AI 能给概率,仓位是你的功课。 研究显示,“押多少”是与“选哪边”完全独立的能力轴。Claude 的下注金额与自身信心呈负相关(越没把握越重仓“价值洼地”),结果成为唯一亏损者;Grok 的下注与信心高度同步(相关系数 0.85),重仓最强判断,收益最好。让 AI 帮你整理信息和概率是合理的,但“投入多少”这道题的纪律,目前还得自己守。

二、“和市场一致”不是没水平。 四个模型的概率与市场赔率的相关系数高达 0.97 以上。当信息高度公开时,任何工具给出的答案都会趋同——这时声称自己有“独家内幕”的,反而值得警惕。

三、选 AI 助手,要看它认不认错。 研究让每个模型赛后复盘自己的预测。在答错的场次里,Gemini 有 86% 坦率承认“预测错误”;ChatGPT 只有 36%,并把 55% 的错误软化成“部分正确”。预测能力不相上下,自我认知天差地别。如果你要用 AI 的复盘做下一步决策,它是否诚实,比它是否聪明更重要。

原文来源

边界声明 · 这项研究不能证明什么

本文数字来自单届赛事 104 场比赛,模型间准确率差异仅约 3 场,不构成“哪个模型更强”的统计结论;1X2 规则只计 90 分钟赛果,点球晋级单独记录;所有投注均为虚拟结算,本文不构成任何投注建议;四个模型为特定版本的消费级助手,表现不代表其 API 或后续版本。


AIGC 内容说明:本文由 AI 辅助起草,数字经人工对照公开数据集逐项核查,经今山海编辑部人工审核后发布。修订与更正将在本页留痕。

原文来源

边界声明 · 这项研究不能证明什么

本文为一手来源的中文编辑导读,结论的适用范围与证据强度以来源原文为准;不构成医疗、投资或其他决策建议。

AIGC 内容说明

本文由 AI 辅助起草,经今山海编辑部人工核对事实、来源与边界后发布。修订与更正将在本页留痕。