论文

MathDuels:不断发展的自我对战基准

MathDuels: A Self-Play Benchmark That Grows

模型评测基准与评测资源

摘要

随着前沿语言模型在静态数学基准上达到接近天花板的性能,现有的评估越来越无法区分模型的能力,很大程度上是因为它们仅将模型作为固定问题集的求解器。我们引入了 MathDuels,这是一个自我对弈基准,其中模型扮演双重角色:每个人在对抗性提示下提出数学问题,并解决每个其他参与者提出的问题。问题是通过三阶段生成管道(元提示、问题生成和难度放大)产生的,并由排除不适定问题的独立验证者进行验证。 Rasch 模型(Rasch,1993)联合估计求解器能力和问题难度;作者质量源自每个模型所编写问题的难度。跨 19 个前沿模型的实验表明,创作和解决能力是部分解耦的,并且双角色评估揭示了单角色基准测试中不可见的能力分离。随着较新的模型进入竞技场,它们产生的问题会击败以前占主导地位的求解器,因此基准的难度与参与者的强度共同发展,而不是在固定的上限处饱和。我们设有一个公共排行榜,该排行榜会随着新模型的发布而更新。