FIFA 2026 世界杯作为 LLM 预测代理的无污染基准:四个模型、一个博彩公司和 104 场比赛
FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches
摘要
我们引入了 WC2026-Agents,这是一个基准和数据集,用于评估 大语言模型 (LLM) 作为真实未来事件的自主预测代理。对于 2026 年 FIFA 世界杯的 104 场比赛中的每一场,四个前沿模型——Claude Opus 4.8、ChatGPT(GPT-5.5,高推理)、Gemini 3.1 Pro 和 Grok(专家模式)——运行相同的搜索-行动-反映循环:使用网络工具收集证据,承诺 1X2(A 队获胜/平局/B 队获胜)分配和虚拟 100 美元投注,并在比赛结束后仅反映最终得分。由于每场比赛都是在模型训练截止后开始的,因此基准测试不会受到构造污染。至关重要的是,我们将四名智能体与来自相同信息环境(赛前投注市场)的第五名竞争对手配对,以每场比赛 1X2 赔率收集,提供了一个经济基础的基线,让我们不仅可以对智能体的预测进行评分,还可以对智能体如何使用金钱进行评分。该版本包含 416 个预测和 414 个反思,带有逐字推理、真值(包括点球大战)、赔率和可重复的评估套件。参考评估揭示了原始准确性隐藏的结果:四位经纪人在 92% 的比赛中给出了相同的首选,并且没有一个能打败市场的 Brier 分数;事实上,市场上最受青睐的天真持股的收益超过了所有四位经纪人。然而,作为决策者,智能体的分歧却很大:投注投资回报率从-18%到+10%不等,市场衰退对这四个人来说都无利可图,引用市场的预测比例从12%到100%不等,自我报告的错误选择错误率从36%到86%不等。因此,基准衡量的是校准、决策质量和自我认知——前沿模型在这些轴上存在差异,即使它们的预测没有差异。数据和代码:https://github.com/graphuofm/FIFA2026LLM