论文

把失败重放为成功:面向指令跟随的样本高效强化学习

Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following

模型训练强化学习RLVR

摘要

强化学习(RL)在让大语言模型(LLM)遵循带各种约束的指令方面展现出前景。尽管结果令人鼓舞,RL的提升不可避免地依赖于采样到成功的高质量回答;然而,受自身能力所限,初始模型往往难以生成满足所有约束的回答,产生稀疏或难以区分的奖励,阻碍学习。在这项工作中,我们提出Hindsight instruction Replay(HiR),一个面向复杂指令跟随任务的新型样本高效RL框架,它采用先选择后重写的策略,基于事后已被满足的约束,把失败的尝试重放为成功。我们在这些重放样本以及原始样本上执行RL,在理论上将目标构造为指令级与回答级两个层面的双重偏好学习,从而仅用二元奖励信号即可实现高效优化。大量实验表明,所提出的HiR在不同指令跟随任务上均取得可观结果,同时所需计算预算更少。我们的代码与数据集见 https://github.com/sastpg/HIR。

把失败重放为成功:面向指令跟随的样本高效强化学习 配图
图 1:(左)当前 RLVR 方法在指令遵循任务中稀疏且不可区分奖励问题的概念性示意。(右)HiR 训练的小型 LLM 与前沿 LLM 在不同基准上的性能比较。