论文
带计划引导的选择性离策略参考调优
Selective Off-Policy Reference Tuning with Plan Guidance
摘要
带可验证奖励的强化学习有助于推理,但GRPO式方法在所有采样rollout都失败的高难度提示上会停滞。SORT在不改变rollout生成的前提下为这些失败增加一次修复更新:它从参考解答中推导计划,比较有无该计划时的token概率,并对在计划条件下变得更可预测的token赋予更高权重。这将全错的提示转化为选择性、结构感知的学习信号,而非一味的均匀模仿。在三个基座模型与八个推理基准上,SORT优于GRPO及引导基线,且在较弱模型上增益最大。
