论文

重新思考序列级强化学习中的比较单元:从损失校正到样本构建的等长配对训练框架

Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction

模型训练强化学习

摘要

本文研究了序列级相对强化学习中的长度问题。我们观察到,尽管现有方法部分缓解了与长度相关的现象,但一个更根本的问题仍然没有得到充分表征:训练期间使用的比较单位缺乏固有的可比性。基于这一观察,我们提出了一个新的观点:长度问题不应仅仅被视为损失缩放或归一化偏差,而应被视为\emph{比较单元构造}问题。我们进一步建立了一个基于样本构建的训练框架,该框架不是对不等长度的响应应用事后修正,而是在生成过程中主动构建等长、可对齐和可比较的训练片段。在此框架内,我们提出了 EqLen,这是一种适用于 GRPO、GSPO 和 RLOO 等组相关比较算法的具体方法。 EqLen通过双轨同步生成、前缀继承、段屏蔽等方式,高效收集有效等长训练段,实现稳定的训练。