论文

并非所有证明都是平等的:评估 LLM 证明质量超越正确性

Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

模型评测基准与评测资源

摘要

大语言模型 (LLM) 已成为有能力的数学问题解决者,经常为具有挑战性的问题提供正确的证明。然而,仅仅正确性是不够的:数学证明还应该清晰、简洁、富有洞察力,并且可以转移到其他问题。虽然这种证明的质量是主观的并且取决于读者和上下文,但它的许多组成部分都是具体的并且受到广泛重视。在这项工作中,我们确定了这些组件并引入了 ProofRank,这是一个从具有挑战性的数学竞赛中策划的基准。 ProofRank 评估证明质量的几个可扩展代理:(i)简洁性,衡量证明是否避免不必要的步骤; (ii) 计算简便性,衡量证明对繁琐计算的依赖程度; (iii) 认知简单性,衡量所使用的证明技术的易用性; (iv) 多样性,衡量模型对单个问题的证明的差异程度; (v) 适应性,衡量模型是否可以遵循指定的证明技术。在各个模型中,我们发现证明质量存在显着差异,而仅正确性基准无法捕获这些差异。我们还观察到证明质量指标和正确性之间的显着权衡,这表明未来对数学推理的评估应该衡量 LLM 生成的证明的有用性。