论文
反思数学推理评估:超越符号僵化的鲁棒LLM-as-a-Judge框架
Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity
摘要
大语言模型的最新进展带来了各类任务的显著提升,其中包括数学推理——它被用来评估模型在逻辑推理与问题求解上的智能水平。在数学推理基准上,模型评估的方式是将最终答案与标准答案比对以验证其正确性。这类验证的常见做法基于符号数学比较,但无法在多样的数学表示与解答格式之间泛化。在本工作中,我们提供了一种鲁棒且灵活的替代方案,以取代基于规则的符号数学比较。我们提出一个基于LLM的评估框架来评估模型生成的答案,从而在多样的数学表示与答案格式上实现准确评估。我们展示了两个流行框架Lighteval与SimpleRL中符号评估的失败案例,并将其与我们的方法对比,证明了相对常用方法的明显改进。我们的框架支持更可靠的评估与基准测试,带来更准确的性能监控,这对推进数学问题求解与智能系统的发展十分重要。
