论文

转动 离策略 词元 同策略:改进 LLM 对齐的插件方法

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

模型训练强化学习

摘要

大语言模型 (LLM) 的强化学习 (RL) 后训练 遵循“采样轨迹后更新”的有效范例,这不可避免地会产生 离策略 训练数据。为了解决这个问题,提出了重要性采样(IS),而 词元级 比率在长序列上复合,导致严重的方差爆炸。一个自然的想法是将这些 离策略 词元“转移”为 同策略 词元,这样就不需要校正的重要性分数。遵循这个想法,我们提出了选择性重要性抽样(SIS),它受到拒绝抽样的启发。具体来说,SIS通过将离策略模型视为提案分布来实现,并实现词元级拒绝测试:接受的词元被视为同策略,以便获得单位重要性得分,而拒绝的词元保留标准IS校正。我们提出的 SIS 从理论上证明可以缩小 词元级 和序列级 离策略 梯度估计器之间的差距。 SIS 充当插件,仅修改策略丢失中的重要性比率,增加可忽略不计的挂钟开销,并且可以与各种 RL 后训练 算法结合使用。在密集和 MoE LLM 上跨数学和代理基准的实验表明,SIS 持续改进所有目标,同时在 离策略 数据下提供更强的鲁棒性。