论文

RePro:经过证明验证的基准重写,用于可靠评估 LLM 数学问题解决

RePro: Proof-Verified Benchmark Rewriting for Reliable Evaluation of LLM Mathematical Problem Solving

模型评测评测方法与指标

摘要

数据污染破坏了 大语言模型 (LLM) 对数学问题解决的可靠评估。虽然基于重写的评估减轻了记忆力,但现有方法缺乏对问题有效性和答案正确性的保证。我们提出了证明验证基准重写(RePro),这是第一个将面向精益的神经自动定理证明器(ATP)集成到基准重写中的框架,它重写问题并重新生成答案,并通过精益验证的证明确保正确性。在 GSM8K 和 MATH 上的实验表明,RePro 保留的重写实例实现了 100% 明确性、可行性和答案正确性,而现有方法仍然会产生无效或不正确的实例。此外,一些模型在经过验证的重写基准上表现出准确性下降,这表明它们的性能对表面水平和结构变化敏感,并且可能部分反映了记忆效应。我们的源代码和数据可在 https://github.com/AI4Engi/RePro 获取。