WorldCupArena:大模型与深度研究智能体足球预测的细粒度评测基准 WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting
用2026世界杯104场比赛,细粒度评测大模型与智能体的赛前足球预测能力。
前置知识
深度研究智能体 (Deep-Research Agent)
深度研究智能体是大语言模型加上联网搜索与工具调用能力的组合系统。它不只是回答问题,而是自主决定搜什么、点开哪些网页、综合多源信息后给出带引用的结论,代表产品有 Gemini Deep Research、带 Search 的 ChatGPT 等。本文中它处于 S2 设置:只给定比赛对阵,需自行上网搜集证据。
本文核心问题之一是「联网搜索是否真能提升赛前预测」,因此必须区分纯模型 (S1) 与带搜索的智能体 (S2) 两种形态。
Brier 分数 (Brier Score)
Brier 分数衡量概率预测的校准程度,定义为 $\text{Brier}=\frac{1}{N}\sum_i(p_i-o_i)^2$,其中 $p_i$ 是预测概率、$o_i$ 是实际结果 (0 或 1),越低越好。本文用三路 (主胜/平/客胜) Brier,并转为越大越好的分数显示。
结果准确率只看最高概率类是否命中,会把 45% 和 90% 的预测同等对待;Brier 能惩罚过度自信的错误,是评估概率质量的关键补充。
1X2 盘口 / 三路结果 (Home-Draw-Away)
1X2 是博彩业对足球结果的标准记法:1 代表主队胜、X 代表平局、2 代表客队胜。模型需对三类结果各给一个概率且三者之和为 1。赛前赔率隐含概率常被当作强基线。
T1 层的核心就是 1X2 概率与最可能结果,理解这个三元结构才能看懂结果准确率、Brier 和 Scoreline 三项指标的关系。
Scoreline 比分相近度指标
本文自定义的指标,对预测比分与真实比分的接近程度给部分分。公式 $S_{\text{score}}=45I_r+25(1-e^{-d/5})+20(1-e^{-t/6})+10(1-e^{-t_{\text{team}}/8})$:$I_r$ 标记结果类是否正确,后三项用指数饱和函数分别惩罚净胜球差 $d$、总进球差 $t$ 和分队进球差 $t_{\text{team}}$,完全猜对得 100。
这是论文区分「精确命中」与「合理偏差」的关键创新,也是模型相对博彩基线领先最明显的指标。
sMAPE / Kendall τ
sMAPE 是对称版 MAPE,公式 $\frac{1}{n}\sum\frac{|A_t-F_t|}{(|A_t|+|F_t|)/2}$,对预测与真实值都除以二者绝对值的平均,避免真实值接近零时爆炸。Kendall $\tau$ 衡量两个排序的一致性,取值 $[-1,1]$,等于一致对数减不一致对数再除以总对数,$\tau=1$ 表示排序完全相同。
T4 战术统计层用 sMAPE 评分控球/射门等计数,T5 整届赛事层用 Kendall $\tau$ 衡量预测的小组排名是否接近真实排名,二者都是细粒度打分的关键工具。
Elo 评分系统
Elo 用胜负结果动态更新球队强度的评分方法:赢则升、输则降,强弱差距越大更新幅度越小,足球领域常用它把队伍强度转化为胜率。
论文把 Elo、Poisson、Dixon-Coles、贝叶斯层次模型等列为传统结果预测方法,理解它能区分「传统统计模型」与「本文评测的通用大模型」两类范式。
研究动机
现有的大模型评测大多是事后问答——题目答案早已存在于训练语料或互联网中,无法检验模型在事件发生前做出有用预测的能力。即便 ForecastBench、RealTime QA、LiveBench 这类动态评测会等待未来结果再打分,它们通常仍只关注单一答案或粗粒度事件结果(如某事是否发生),很少考察模型能否在多组相关预测上连贯地利用最新证据。在体育领域,SoccerNet-v2、MatchTime、UniSoccer、Sports-QA、SPORTU 等基准评测的全是已结束的比赛(找视频里的动作、把转播和评论对应起来等);而传统足球预测方法(Poisson、Dixon-Coles、贝叶斯层次模型、Elo、混合随机森林)几乎只预测胜负或比分分布。一个具体困境极具说服力:当博彩市场给西班牙 89.1% 的胜率、佛得角几乎没机会时,13 个被测系统全部预测 3–0 或 4–0,结果实际是 0–0 平局——模型们会一起被同一个热门带偏,而现有基准既看不出这种系统性失败,也看不出谁在「细节预测」上更靠谱。
本文的目标是本文要构建一个可长期复用、赛前时序、细粒度的大模型/智能体足球预测评测基准。它要求模型在每场比赛开球前 24 小时提交完整预测:不只是胜平负和比分,还要预测首发阵容、进球者与助攻、换人/红黄牌等事件时间、控球射门角球等战术统计,以及整届赛事的小组排名、淘汰赛对阵直到冠军归属。所有预测在赛前冻结快照、保存证据来源与时间戳,赛后与官方记录独立比对打分。以 2026 FIFA 世界杯全部 104 场比赛作为首次评测,并让同样的四步流程能在未来的联赛、杯赛乃至其他运动上重复使用,从而持续评测世界杯之后才发布的新模型——避免它们假装「不知道」已知结果。
与已有工作不同的是,本文的独特切入点在于三点的结合。第一,坚持赛前时序设置(现有体育基准都是赛后),同时要求通用模型给出比传统方法更完整的预测(传统方法只看胜负/比分),把「赛前」和「细粒度」首次统一起来。第二,把「精确命中」与「合理偏差」分开打分——Scoreline 指标对接近的比分给部分分,再加上 T1–T5 五层结构,能揭示「结果准确率几乎一样高的模型在球员、事件、统计上却差异巨大」这一被单指标掩盖的事实。第三,在数据缺失处理上做对了——把「确实没发生」(如无红牌)与「没有记录」区分开,对缺失真值直接剔除而不计为零,并对可能泄漏结果的预测予以剔除而非算错。这种「分项细粒度 + 严格防泄漏 + 可复用」的组合在已有工作里是空白的。
核心方法
整体思路很直观:既然要看模型会不会在赛前做出连贯的多维度预测,那就照真实赛程跑一遍——给模型与人类专家一样的赛前信息窗口,让它交一份完整的「预报单」,赛后再用官方记录逐项核对。技术路线是四个固定步骤(每个 fixture 都一样):登记未来赛程 → 收集赛前信息 → 在开球前 24 小时冻结预测快照 → 赛后取官方记录打分。预测被组织成五层 T1–T5:T1 核心结果(1X2 概率、精确比分、比分相近度、净胜球,层权重 0.40);T2 球员层(首发、阵型、进球者、助攻、最佳球员,权重 0.20);T3 事件层(进球时间、换人、红黄牌、点球、乌龙,权重 0.15);T4 战术统计层(控球、射门、角球等,权重 0.15);T5 整届赛事层(小组排名、对阵、冠军,权重 0.10)。整届预测通过两次模型调用生成:先预测全部 72 场小组赛,代码据此算出积分榜和 8 个最佳第三名,再让模型基于自己的小组预测去预测 32 场淘汰赛,冠军/亚军/季军从保存的比赛列表推导而非作为独立声明。
核心创新不在某个新模型,而在评测协议与打分设计。最关键的是 Scoreline 这个「相近度」指标:传统精确比分只分对错,而本文用公式 $S_{\text{score}}=45I_r+25(1-e^{-d/5})+20(1-e^{-t/6})+10(1-e^{-t_{\text{team}}/8})$,对正确的胜负结果给 45 分,再用三个指数饱和项奖励接近的净胜球差 $d$、总进球差 $t$ 和分队进球差 $t_{\text{team}}$,这样把「合理偏差」和「离谱偏差」彻底分开。另一个本质区别是 availability-aware 聚合:层内/层间得分都是在可得分量上做加权平均 $S_A=\frac{\sum_{j\in A}w_j S_j}{\sum_{j\in A}w_j}$,缺失的真值被剔除而非当作零分,并严格区分「确实没发生」与「没有数据」。再加上赛前 24 小时冻结快照、保存证据与来源时间戳、剔除泄漏结果的预测,这套协议让单凭「结果准确率」无法分辨的模型在多个维度上现出原形——这也是「联网搜索对比赛预测没帮上忙」这类反直觉结论能被可信地观测到的前提。
方法步骤详情
每场比赛流水线五阶段。第一步 Ingest:创建 fixture 快照。第二步 Populate:挂载大名单、近期状态、新闻、统计、赔率,默认开球前 7 天入库、赛前一天填充证据。第三步 Lock-and-predict:开球前 24 小时冻结快照哈希并按 (模型×设置) 写记录;模型返回统一 JSON(1X2 概率、预测比分、球员、事件、统计及文字解释),S1 给所有模型同一证据包且禁用工具,S2 只给对阵让智能体自行联网搜索。第四步 Truth ingest:赛后独立采集比分、阵容、事件、统计并归一化;预测先过 JSON Schema 再过语义校验(概率归一、结果类一致、每方 11 人、统计含主客值),失败则发修复提示整体替换且不泄露赛后真值,仍失败计为无效。第五步 Grading:T1 用 Brier/精确/Scoreline,T2 用 Jaccard/F1/nDCG,T3 用匈牙利算法匹配事件并按错误球员/分钟扣分,T4 用 sMAPE,T5 用 Kendall $\tau$ 算小组排名、各轮晋级/对阵(权重 1/2/4/8/16)与冠军,最后做 fixed-contrast 校准。
技术新颖性
技术新颖性体现在评测工程而非新算法。其一,五层细粒度结构是首个把赛前结果、球员、事件、战术、整届赛事统一打分的足球基准。其二,Scoreline 的指数饱和分项设计巧妙——各项分别饱和、结果类权重最大、总和永不为负,既奖励接近又不会让大偏差产生负分。其三,区分「没发生」与「没记录」、对缺失真值剔除而非置零,避免系统性低估。其四,赛前快照 + 来源时间戳 + 泄漏剔除的防作弊机制使结果可审计。其五,完全可复用——换赛事只换赛程与赛制规则,比赛级指标不变,新模型在未来赛事上评测天然无泄漏。其六,保存原始响应、解析对象、执行元数据(延迟、token、成本、工具调用次数、快照哈希、校验状态)双层存档,使解析器升级不等于「模型输出变了」,保证可独立复算。这些设计组合起来让基准既能当排行榜用,也能当研究工件用。
实验结果
13 个系统跑完 104 场世界杯比赛。其一,结果准确率缺乏区分度:最高 70.7% (Claude Opus 4.7 Thinking+Search),但 GLM-5.1、Kimi、DeepSeek、GPT-5.4(Search) 都在 68% 上下;Composite 总分上 Claude Opus 4.7 (Thinking) 以 33.76 居首。其二,精确比分极难(各系统仅 10.3%–17.2%),而 Scoreline 拉开差距——Claude Opus 4.7 (Thinking+Search) 达 68.49,比 BetVictor 53.35、人类球迷 53.40 高约 15 分,是相对基线最显著的领先。其三,联网搜索对比赛预测无益:加搜索使整体分变化 $-0.26$ (Claude)、$-4.26$ (GPT-5.4)、$-1.03$ (Gemini)。其四,整届预测小组排名各家接近 (83.3–88.9) 但淘汰赛对阵悬殊 (15.3–71.0);4 个系统押中冠军西班牙、T5 达 88.3/87.4,仅两个 Claude 配置押对西班牙–阿根廷决赛,其余仅 39.1–49.0。低比分赛最难(结果 57.7%、精确 4.6%)。共识失败明显——西班牙 0–0 佛得角(13 系统全押 3–0/4–0)、法国 4–6 英格兰,暴露模型被同一热门集体带偏的风险。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 比赛结果准确率 (1X2) | Accuracy % | Claude Opus 4.7 (Thinking+Search) 70.7% | 人类球迷 69.7% / BetVictor 68.3% / Polymarket 65.4% | +1.0 vs 人类,+2.4 vs BetVictor,+5.3 vs Polymarket(提升很小) |
| 精确比分准确率 | Accuracy % | Claude Opus 4.7 (Thinking+Search) 17.2% | BetVictor 16.3% / 人类球迷 15.6% / Polymarket 8.7% | +0.9 vs BetVictor(接近基线) |
| Scoreline 比分相近度 | Scoreline (0-100) | Claude Opus 4.7 (Thinking+Search) 68.49 | BetVictor 53.35 / 人类球迷 53.40 | +15.14 vs BetVictor,+15.09 vs 人类(最显著领先) |
| 整体 Composite 总分 | Composite (校准后) | Claude Opus 4.7 (Thinking) 33.76 | Qwen3.7 Max 22.78(最弱合格系统) | 领先最弱系统约 11 分 |
| 整届赛事 T5 | T5 (0-100) | Claude Opus 4.7 (Thinking+Search) 88.3 | Gemini 3.1 Pro (Thinking) 39.1(未押中冠军) | +49.2(押中冠军+决赛对阵 vs 全没押中) |
局限与改进
作者坦承多项局限。首先是系统级比较的因果不可分:一个系统表现好可能来自更强的底座、更好的搜索工具、更优的概率校准或仅是更可靠的输出格式,基准评测的是「用户拿到的完整产品」,无法证明是哪个内部组件带来差异。其次是泄漏与版本漂移:网页发布时间不可靠,服务商可能在同一公开名字下悄悄换模型,重要的搜索类对比仍需人工复核。第三是模态单一——当前只用文本与结构化统计,未引入视频、新闻发布会、追踪数据或阵型图。第四是样本规模:104 场比赛对分层分析偏小,91+ 分钟段只有 8–9 场不能当稳定排名;且 2026 世界杯结束后新模型已无法对其做真正的赛前预测。第五是赛中实时轨道轮询并非严格定时,模型间检查点数量不同。我自己补充几点观察:全部 13 个系统都是商用闭源产品,缺乏开源对照难以归因;仅一届赛事的结论对「搜索无用」这种论断统计力不足;校准把原始 Composite 压在 50 附近(33.76 这种显示分依赖变换),原始区分度其实有限;真值适配器主要依赖单一数据商,球员/事件字段未做多源核验。
独立分析的弱点
独立看,本文有几处可改进的弱点。第一,「联网搜索对比赛预测无益甚至有害」可能被高估:样本仅 3 个模型、共享比赛 50–95 场且架构差异大,更可能是检索质量、网页噪声或智能体决策粗糙所致,改进方向是设计受控的「同底座 ±搜索」对照并引入检索质量评估。第二,评测对象全是闭源商用系统,缺开源基线难以归因,可补开源模型 + 统一推理框架。第三,单届赛事 104 场对低比分/大热门/淘汰赛等子集样本太小,分层结论应视为描述性而非显著性检验,建议跨多届赛事累积样本。第四,校准把原始 Composite 压在 50 附近(33.76 依赖显示变换),原始区分度有限,可考虑直接报告原始分或配对胜率。第五,真值适配器主要依赖单一数据商、球员/事件未做多源核验,建议引入全球体育本体与第二信源。第六,文中说「保存原始响应」但未公开格式可靠性(无效/修复比例)这一可操作性指标。第七,共识失败(西班牙 0–0 佛得角)暴露模型同质化,但基准尚未给出「反共识」或独立性奖励指标,可增设鼓励独立判断的子分。
未来方向
作者明确指出未来方向:把基准扩展到其他联赛、杯赛甚至其他运动,沿用同一赛前调度;保留 2026 世界杯作为已完成记录,新模型在未来赛事上评测以天然防泄漏;引入视频片段、新闻发布会、追踪数据、阵型图等新模态作为清晰定义的输入设置,使任何提升都能归因到新证据;改进搜索来源时间戳、建立全球体育本体做实体规范化。基于成果我补充几个可延伸方向:一是用同底座模型做 ±搜索、±工具的受控消融,真正回答「证据质量如何影响预测」;二是把赛前预测与赛中预测、乃至博彩赔率校准纳入统一概率框架,研究模型是否校准良好;三是既然多模型会在大热门上集体翻车,可设计反共识或情景扰动指标奖励独立判断;四是把多模态(广播视频、战术热图)接入 T2–T4,检验视觉证据能否改善阵容/事件/统计预测;五是用该基准做强化学习或自我博弈式的预测智能体训练。
复现评估
可复现性整体较好。作者在 GitHub (github.com/wzk1015/WorldCupArena) 开源了代码、提示词、全部预测与评测脚本,并采用工件驱动的双层存档:执行元数据(模型 ID、设置、提交时间、延迟、token、成本、工具调用次数、快照哈希、原始响应、校验状态、错误摘要)与解析后的 schema 对象分开保存,使解析器升级可对原始响应重测而不谎称模型输出变了。所有指标都能在保存的预测+真值文件上独立复算,评分版本升级会自动从存档刷新。算力方面只需调用 13 个商用 API,成本可控,无大规模训练。但有几处注意:商用服务商可能在同名下悄悄更新模型,网页发布时间不可靠,故重要搜索类对比需人工复核;真值适配器依赖单一数据商且球员/事件未做多源核验;赛中轨道轮询非严格定时。综上,方法学与工件层面高度可复现,但商用模型版本的不可控与外部数据时序的不确定性是不可消除的噪声源,复现者应重点关注系统级结论而非单点数字。
论文图表