论文
LemmaBench:一个评估LLM数学能力的动态研究级基准
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
摘要
我们提出一种评估大语言模型(LLM)研究级数学能力的新基准方法。现有基准大多依赖静态、人工精选的竞赛或教科书式问题集来代理数学研究。相反,我们建立一个可更新的基准,直接用最新的数学研究成果评估模型。它包含一个自动流水线,从arXiv提取引理,并通过显式化所有假设与所需定义把引理改写为自包含的命题。由此得到的基准可以定期用直接取自人类数学研究的新问题更新,同时既往实例可用于训练而不损害未来评估。我们对当前最先进的LLM进行了基准测试,其定理证明(pass@1)准确率依模型而定约为10-15%,表明LLM要达到研究情境中人类水平的证明能力,目前仍有很大的进步空间。
