论文
STRIDE:LLM 推理的可学习逐步语言反馈
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
摘要
强化学习 (RL) 的最新进展强调了其激励 大语言模型 (LLM) 推理能力的潜力。然而,现有的步骤级工作受到昂贵的注释的影响,限制了领域覆盖范围,而标量分数进一步造成了信息瓶颈,无法提供足够的语义带宽来改进中间决策。另类语言批评方法依赖于冻结的或外部的批评家,提供更丰富的文本反馈,但缺乏持续政策改进所需的可扩展性。在这项工作中,我们提出了语言驱动的逐步轨迹重定向,称为 STRIDE,这是一种新颖的训练框架,它将过程监督从标量奖励转变为可学习的逐步语言反馈。具体来说,我们仅使用基于结果的奖励来共同训练生成器和生成验证器,消除外部注释,同时通过联合一致的验证器训练提供持续的策略改进。验证者的逐步语言批评明确地定位和解释失败,使生成器能够在中间步骤中将推理轨迹重定向到替代决策。即使在嘈杂或次优的验证者反馈下,轨迹重定向设计也能保证无害的策略改进。各种推理基准的实验表明,STRIDE 显着优于最先进的基线,并且在我们的消融研究中标量方法不产生学习信号的零通过率问题上取得了突破,证明了可学习的逐步语言反馈对于增强 LLM 推理的有效性。