论文

WorldCupArena:语言模型与深度研究智能体足球预测的细粒度评估

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

模型评测基准与评测资源

摘要

在开球前预测一场足球赛不只要求知道历史结果:模型必须利用不断变化的信息,并在答案可得之前做出明确预测。我们提出WorldCupArena,一个面向语言模型与深度研究智能体的动态基准。2026年FIFA世界杯是其首次评估,同一流程可复用于未来的联赛与杯赛。每场比赛前,模型要么接收统一的证据包,要么自行检索信息;它预测比赛结果与比分、可能出场球员与事件、比赛统计以及赛事最终归属。赛后,这些预测与记录在案的结果比对。我们报告结果准确率、精确比分准确率,以及当预测比分接近但不精确时给予部分分数的比分线分数,连同其他预测任务的分数。跨系统看,相近的结果准确率可能掩盖详细预测上的更大差异。四个系统预测冠军为西班牙,其中两个还复原了确切的决赛对阵。与博彩市场及人类球迷基线相比,最佳系统在结果与精确比分准确率上只有小幅优势,但在比分线分数上增益更清晰。新赛程开始时即可加入,使基准无需使用已知结果即可评估未来模型。代码、预测与评估脚本将公开。