论文

总结失败之处:从自适应教师指导中恢复负强化学习组的学习信号

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为 后训练 大语言模型 (LLM) 的标准范例。虽然组相对策略优化(GRPO)被广泛采用,但它会受到奖励信号稀疏的影响,并且当组内的所有响应都获得相同的奖励时,它会完全失去梯度。 同策略 蒸馏 (OPD) 通过从教师模型提供密集的 词元级 监督来提供自然补救措施。然而,由于三个根本原因,天真地将 GRPO 与 OPD 结合起来会导致性能下降:并非所有样本都受益于 蒸馏;太快地适应老师会削弱强化学习的探索能力;而OPD的优势是不对称的,压制了大部分词元。为了应对这些挑战,我们提出了 RSTG(通过自适应教师指导恢复学习信号),它有选择地、精确地在最重要的地方应用 蒸馏。在样本级别,OPD 仅限于负零方差提示,每个样本均按教师的置信度得分进行加权。在 词元级 中,蒸馏 仅针对具有高学生熵或大师生分歧的标记。我们进一步使用 SFT 对教师模型生成的正确轨迹进行增强训练,在 RL 不产生任何信号的情况下注入正梯度信号。实验表明,RSTG 在数学上比原始 GRPO+OPD 显着优于 4.02%,在代码上比原始 GRPO+OPD 高出 3.05%。