论文

反思数学推理评估:超越符号僵化的鲁棒LLM-as-a-Judge框架

Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

模型评测评测方法与指标

摘要

大语言模型的最新进展带来了各类任务的显著提升,其中包括数学推理——它被用来评估模型在逻辑推理与问题求解上的智能水平。在数学推理基准上,模型评估的方式是将最终答案与标准答案比对以验证其正确性。这类验证的常见做法基于符号数学比较,但无法在多样的数学表示与解答格式之间泛化。在本工作中,我们提供了一种鲁棒且灵活的替代方案,以取代基于规则的符号数学比较。我们提出一个基于LLM的评估框架来评估模型生成的答案,从而在多样的数学表示与答案格式上实现准确评估。我们展示了两个流行框架Lighteval与SimpleRL中符号评估的失败案例,并将其与我们的方法对比,证明了相对常用方法的明显改进。我们的框架支持更可靠的评估与基准测试,带来更准确的性能监控,这对推进数学问题求解与智能系统的发展十分重要。

反思数学推理评估:超越符号僵化的鲁棒LLM-as-a-Judge框架:论文配图
图 1:与传统的符号评估方法相比,我们的LLM评估方法通过处理不同的数学表示和答案格式提供了更稳健的评估。这些例子通过正确评估数学问题的这些模型预测来证明我们的方法的贡献,而现有的数值比较方法则失败了。