论文
STRIDE:经验证任务的策略轨迹推理经判别估计
STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning
摘要
带可验证奖励的强化学习(RLVR)已成为提高大型语言模型推理能力的有效后训练范例。然而,现有的 RLVR 方法通常依赖于最终答案的正确性来分配轨迹级奖励,提供稀疏监督并统一处理所有词元,无论它们对推理的实际贡献如何。尽管最近的研究引入了过程奖励、高熵词元和语义不确定性等中间信号,但这些信号通常本质上不可验证,并且可能无法区分有益的战略模式和有害的战略模式。为了解决这一限制,我们提出了 STRIDE(具有判别性估计的策略轨迹推理),这是一种细粒度的 RLVR 框架,可从可验证的结果中导出策略推理监督。 STRIDE 对比每个响应组内的成功和失败轨迹,以估计每个 $n$-gram 策略模式的结果歧视偏好,并进一步将此信号与推理显着性熵相结合,以识别与决策相关的策略模式。这些模式在 RL 优化过程中被分配有差异化的优势值,从而实现更精确的贡献分配,同时保留 RLVR 的可验证性。大量实验表明,STRIDE 能够持续提高跨不同模型、任务和扩展设置(包括 VLM 和基于代理的系统)的推理性能。
