论文

带计划引导的选择性离策略参考调优

Selective Off-Policy Reference Tuning with Plan Guidance

模型训练强化学习RLVR

摘要

带可验证奖励的强化学习有助于推理,但GRPO式方法在所有采样rollout都失败的高难度提示上会停滞。SORT在不改变rollout生成的前提下为这些失败增加一次修复更新:它从参考解答中推导计划,比较有无该计划时的token概率,并对在计划条件下变得更可预测的token赋予更高权重。这将全错的提示转化为选择性、结构感知的学习信号,而非一味的均匀模仿。在三个基座模型与八个推理基准上,SORT优于GRPO及引导基线,且在较弱模型上增益最大。

带计划引导的选择性离策略参考调优:论文配图
图 1:500 个优化步骤的训练动态。行显示奖励、响应长度和熵;柱子显示了三个主干。 SORT 提高了奖励,而无需 LUFFY 和 ReLIFT 中的长度扩展。