论文
Riemann-Bench:登月级数学的基准
Riemann-Bench: A Benchmark for Moonshot Mathematics
摘要
近期的AI系统已在国际数学奥林匹克竞赛上达到金牌水平的表现,展现出卓越的竞赛式问题求解能力。然而,竞赛数学只代表数学推理中狭窄的一隅:题目来自有限的领域,几乎不需要高等工具,且往往更嘉奖巧妙的技巧而非深厚的理论知识。我们提出Riemann-Bench,一个由专家精选题目构成的私有基准,旨在评估AI系统在远超奥赛边界的研究级数学上的能力。题目由常春藤盟校的数学教授、研究生和拥有博士学位的IMO奖牌得主撰写,作者们独立求解这些题目通常要花费数周时间。每道题都经过两位独立领域专家的双盲验证,他们必须从零开始解题,且每题都有唯一的闭式解,由程序化验证器评估。我们将前沿模型作为不受约束的研究智能体进行评估,赋予其完整的编程工具、搜索和开放式推理权限,并使用对每道题100次独立运行计算的无偏统计估计量。我们的结果显示,目前所有前沿模型的得分均低于10%,暴露出奥赛级问题求解与真正研究级数学推理之间的巨大差距。通过保持基准完全私有,我们确保测得的性能反映真实的数学能力,而非对训练数据的记忆。