论文
揭开推理过程:一个评估LLM结构性数学推理的过程感知基准
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
摘要
近期大语言模型(LLM)在许多既有数学推理基准上达到近乎饱和的准确率,引发对其诊断真实推理能力之能力的担忧。这种饱和主要源于现有数据集中模板化计算与浅层算术分解的主导地位,它们低估了多约束协调、建构性逻辑合成与空间推断等推理技能。为填补这一空白,我们提出ReasoningMath-Plus,一个包含150道精心整理问题、显式设计用于评估结构性推理的基准。每道题强调在交互约束下的推理、建构性解的形成或非平凡的结构洞见,并标注了最小推理骨架以支持细粒度的过程级评估。与数据集一起,我们提出HCRS(Hazard-aware Chain-based Rule Score),一个确定性的步级评分函数,并在标注的推理轨迹上训练过程奖励模型(PRM)。实证上,领先模型的最终答案准确率相对较高(最高5.8/10),但基于HCRS的整体评估得分明显更低(平均4.36/10,最佳5.14/10),表明仅看答案的指标会高估推理鲁棒性。