论文
通过示例路由统一组相关和自身 蒸馏 策略优化
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
摘要
具有可验证奖励的强化学习(RLVR)已成为 后训练 大语言模型 的标准范例。虽然组相对策略优化 (GRPO) 被广泛采用,但其粗略的奖励归因统一惩罚失败的采样轨迹,缺乏有效解决特定偏差所需的 词元级 焦点。自我 蒸馏 策略优化(SDPO)通过提供更密集、更有针对性的 logits 级监督来解决这个问题,该监督有助于快速的早期改进,但在长时间的训练过程中经常崩溃。我们将这种后期不稳定归因于两个内在缺陷:在已经正确的样本上进行的自我 蒸馏 引入了优化模糊性,并且自我教师的信号可靠性逐渐降低。为了解决这些问题,我们提出了样本路由策略优化(SRPO),这是一个统一的 同策略 框架,它将正确的样本路由到 GRPO 的奖励调整强化,并将失败的样本路由到 SDPO 的目标 logits 级别校正。 SRPO 进一步结合了熵感知动态加权机制,以抑制高熵、不可靠的 蒸馏 目标,同时强调自信的目标。通过五个基准和两个模型尺度的评估,SRPO 实现了 SDPO 的快速早期改进和 GRPO 的长期稳定性。它始终超越两个基线的峰值性能,将 Qwen3-8B 的五个基准平均值比 GRPO 提高 3.4%,比 SDPO 提高 6.3%,同时产生适中的响应长度并将每步计算成本降低高达 17.2%。