论文

超越标准答案:大语言模型逐步数学验证的稳健性评估

Beyond the Answer Key: Robustness Evaluation of Large Language Models for Step-Level Mathematical Verification

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地用作评分者、验证者和过程审核者,但大多数数学评估仍然强调最终答案的准确性。这可能会掩盖模型是否可以验证非规范但有效的解决方案跟踪。我们引入了一个受控线性方程基准来评估LLM的评估者角色。每个实例都要求模型判断最终答案的正确性、步骤级跟踪的正确性以及第一个错误的步骤。我们对最先进的开放式LLM的评估揭示了显着的鲁棒性差距:准确评估规范解决方案的模型在遇到扰动但逻辑上等效的变体时通常会失败。在 GPT-OSS 20B、Qwen3-14B 和 Phi-4-Reasoning 中,基本模型在规范轨迹上表现良好,但在扰动轨迹上性能大幅下降,特别是对于错误定位。在有效的扰动轨迹上,基本模型错误拒绝率达到 75.6-85.3%,显示出对规范解形式的高度敏感性。有监督的微调、蒸馏和测试时计算可以提高某些设置中的鲁棒性,但增益取决于模型,并且可能会与规范性能进行权衡。结果表明,可靠的过程级验证仍然具有挑战性,即使在具有精确基本事实的简单代数域中,评估器的鲁棒性也应与求解器的准确性分开测量。

超越标准答案:大语言模型逐步数学验证的稳健性评估:论文配图
图1:基准模型的强力差距。最终的回答评价受到解决方案干扰的影响,但较大的降解发生在先入为主的地方化中,这表明模型往往未能将有效的非天体变异与真实错误分开。