论文
世界杯竞技场:现场锦标赛中对 Frontier LLM 的前瞻性、无泄漏评估
WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
摘要
衡量 大语言模型 预测能力的基准几乎总是回顾性的:事件已经发生,答案就在网络上的某个地方,并且评估必须防止记忆。我们报告了相反的设计。在 2026 年 FIFA 世界杯的 39 天里,六位前沿 LLM(均具有扩展思维和本地服务器端网络搜索)在每次开赛前(一次一场比赛)都会被要求填写所有 104 场比赛的 7 个市场预测卡,以及 12 个小组冠军和赛前总冠军池;提出问题时不存在答案,因此评估通过构造而不是过滤而实现无泄漏,并且冻结档案保存了 4,494 个评分预测。锦标赛建立的是六个系统共享的一组行为。在比赛结果方面,他们的平均赔率为 63.9%,与支持博彩公司最喜欢的球队持平——事实上,这也是他们通常所做的。他们彼此意见一致的次数远远多于他们正确的次数,因此多数票不会增加任何结果。他们对平局和进球的承诺不足,并将他们的比分选择集中到一个典型的结果上。准确性追踪的是一场比赛的不平衡程度,而不是人们对它的了解程度:它在最接近的比赛中崩溃,那里的档案最丰富,而有关整个锦标赛的问题得到了很好的回答。在这项任务上,当前一代的前沿系统并没有明显的区别:在整个运行过程中,排名在顶部和底部保持不变,而在中间则有变动,并且自始至终,利润率都保持狭窄。简报档案、赛程和官方结果连同评分代码一起作为基准发布。