论文

SALT:当更多采样轨迹对基于组的策略优化没有帮助时以及如何使它们发挥作用

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR) 通常采用 GRPO 风格的组相关更新,对每个提示的多次执行轨迹进行采样,以构建标准化的学习信号。然而,仅仅增加执行轨迹数量并不能可靠地加强学习:在 GRPO 式的组标准化下,每次执行轨迹的策略梯度特征可以集中到低秩、带符号的几何中,导致聚合过程中的大量取消并削弱有效更新。我们使用 SALT 来解决这种故障模式,SALT 是一种子空间自适应几何插件组件,它使用样本梯度几何来重新加权组相对更新的系数。 SALT 从小批量 Gram 几何中估计主导共享子空间,将组相关系数分解为共享通道和残余通道,并在符号抵消严重时自适应放大残余通道。在各种面向推理的 RLVR 基准和模型规模中,SALT 改进了有效的更新几何结构和性能,而无需修改奖励模型或执行轨迹采样程序