论文
AI World Cup 2026:LLM端到端足球锦标赛预测基准
AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction
摘要
大语言模型(LLMs)现在经常被要求预测现实世界事件,但比较往往困难,因为模型接收不同信息、使用不同工具,并且根据不同的规则进行评估。本文报告了完成的“AI世界杯”基准测试,在此过程中,十个基于LLM的助手共同做出了2026年国际足联世界杯的所有比赛预赛结果预测。每一份提交都使用相同的锦标赛截图、提示、JSON schema和评分程序。预测涵盖了小组赛得分、小组排名、淘汰赛区段、最终排名、信心值以及简短解释。在所有104场比赛结束后,GPT-5.5 Thinking以744分领先,紧随其后的是GPT-5.5,得分为717分,Gemini得分为699分,Qwen 3.7得分为687分。GPT-5.5 Thinking还选择了西班牙作为冠军,因为他们在决赛中以1-0击败了阿根廷,并且最终排名靠前。最终排名主要由淘汰赛表现决定:总分数与淘汰赛得分(r=0.986)高度相关,但与小组赛得分(r=-0.055)、小组排名(r=-0.103)或其结合的预淘汰赛分数(r=-0.054)之间的关系则非常小。比赛准确率也产生了不同的排序。Claude Sonnet 4.6正确预测了最多的小组赛结果(63.89%),但总体排名第六。平均自报告的信心值与任何结果准确性(r=-0.060)或总分数(r=-0.067)之间也没有关系。这些结果表明,预测整个锦标赛测试的是一次性的比赛预测不同,同时展示了如何一个基于淘汰赛的排行榜依赖于评分设计。基准材料、原始响应和评分代码已发布以支持重复和未来扩展。
