论文
LLM-SoccerArena:以体育现实预测评测LLM
LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports
摘要
大语言模型(LLM)越来越多地支持关于不确定未来事件的决策,但评估其预测现实世界结果的能力仍然困难。特别是,现有基准通常是静态和回溯性的,因此无法测试LLM如何在不确定性下综合信息以预测未来事件。我们提出LLM-SoccerArena(https://llm-soccerarena.com),一个前瞻性实时基准,在结果揭晓之前评估LLM预测现实体育赛事的能力。LLM-SoccerArena提供:(1)前瞻性实时基准协议,(2)公开的开源平台,(3)因子化基准设计以及锦标赛相关问题(例如哪支球队将获胜)。LLM-SoccerArena自动记录对未决事件带时间戳、经模式验证的预测,连同提示词、模型版本、工具调用轨迹和成本。因子化设计沿四个维度变化:(1)模型版本(例如GPT-5.5、Claude Opus 4.8);(2)信息访问;(3)提示策略;(4)预测时间跨度。我们通过对2026年FIFA世界杯的大规模评估展示LLM-SoccerArena,其中七个LLM对全部104场比赛和15个锦标赛相关问题生成了预测。我们提供了模型在信息访问、提示策略和预测时间跨度上的详细性能分析。由此,LLM-SoccerArena为最先进LLM的预测性能提供了新证据。例如,具备网页访问的LLM优于没有网页访问的LLM,但优势很小(即Brier分数改进0.023)。总体而言,LLM-SoccerArena为未决事件的前瞻性基准测试提供了一个灵活的开源平台。LLM-SoccerArena将持续更新,并可直接应用于未来的国内外锦标赛和联赛。
