论文

语言模型可以学会拒绝自己的错误推理步骤吗?

Can Language Models Learn to Reject Their Own Bad Reasoning Steps?

模型推理推理验证与自校正

摘要

验证者引导的解码可以防止有害的推理步骤污染后续生成,但通常依赖于外部学习的验证者。我们询问语言模型是否可以拒绝其自身的错误推理步骤。我们将前缀的可恢复性定义为冻结的生成器可以正确完成它的概率。诊断表明,相邻的可恢复性变化通常很难用实际的蒙特卡罗预算来解决,而相同前缀的候选者则表现出稀疏的低可恢复性尾部。我们引入了自步拒绝 (SSR),它在生成器骨干模型上训练轻量级 LoRA 接受门,同时保持基本模型冻结。 SSR 使用置信度合格的首通道监督:接受第一次解决的交叉根相对可恢复性障碍之前的步骤,拒绝交叉步骤,并排除未解决的步骤和后缀。 训练结合了逐点分类、相同前缀成对学习和使用最终答案正确性的相对组策略细化。在推理时,SSR 接受候选者或在拒绝预算下从未更改的前缀中重新采样,而无需外部学习验证器。在三个推理模型和五个数学推理基准中,SSR 使用生成的token的 1.21--1.40 倍,将单通道解码的宏观平均精度提高了 5.4--10.1 个点,并在评估的步骤级方法中实现了最高的宏观平均精度。为了获得可比较的性能,全解决方案缩放方法需要单通道token成本的 4.47--8.27 倍。