论文
LLaDA-PRM:双向步进推理评估器
LLaDA-PRM: A Bidirectional Step-Level Reasoning Evaluator
摘要
步骤级推理评估器通常基于自回归语言模型,其因果注意力将每个步骤表示限制为问题、先前步骤和当前步骤。然而,当完整的解决方案可用时,早期步骤的有效性可能只有通过其下游后果才能变得更加清晰。我们通过对 1B--3B 规模的因果和双向 LLaDA 评估器进行 54 次受控比较来验证这一假设,仅更改自注意力掩码,并发现双向注意力产生了一致的改进。基于这一发现,我们引入了 \prm{},一个 8B 双向评估器,在 MR-MATH-invalid 上达到 88.8 步级 F1,在分布外 MR-GSM8K 原始问题子集上达到 83.8,分别比 ReasonEval-Llemma-34B 好 11.3 和 10.3 个 F1 点。在评估在线设置中的不完整推理轨迹时, \prm{} 仍然有效,在两个基准上都远远优于最强的基线。我们进一步表明,\prm{} 提供了有效的训练数据选择信号,提高了 Mistral-7B 在 MATH-500 上的性能。