论文

LiveMathematicianBench:带有证明草图的研究级数学推理的实时基准

LiveMathematicianBench: A Live Benchmark for Research-Level Mathematical Reasoning with Proof Sketches

模型评测基准与评测资源

摘要

数学推理是人类智能的标志,大语言模型(LLM)是否能够有意义地执行它仍然是人工智能和认知科学的中心问题。随着 LLM 越来越多地融入科学工作流程,对其数学能力进行严格评估已成为实际需要。现有基准受到综合设置和数据污染的限制。我们推出了 LiveMathematicianBench,这是一个用于研究级数学推理的动态多项选择基准,基于 模型训练 截止后最近发表的 arXiv 论文构建。通过以新发表的定理为基础进行评估,它提供了一个超越记忆模式的现实测试平台。该基准引入了定理类型的十三类逻辑分类(例如蕴涵、等价、存在、唯一性),从而能够跨推理形式进行细粒度评估。它采用了一个由证明草图引导的干扰管道,该管道使用高级证明策略来构建看似合理但无效的答案选择,反映误导性的证明方向,从而提高对表面级别匹配的真正理解的敏感性。我们还引入了一种抗替代机制来区分答案识别和实质性推理。评估显示基准远未饱和:最好的型号Gemini-3.1-pro-preview仅达到43.5%。在抗替代评估下,准确率急剧下降:GPT-5.4 得分最高为 30.6%,而 Gemini-3.1-pro-preview 则降至 17.6%,低于 20% 的随机基线。双模式协议表明,证明草图访问可产生一致的准确性增益,这表明模型可以利用高级证明策略进行推理。总体而言,LiveMathematicianBench 提供了一个可扩展、抗污染的测试平台,用于研究 LLM 中的研究级数学推理。