论文

通过优势和序列权重估计的双通道鲁棒组相关策略优化

Dual-Channel Robust Group-Relative Policy Optimization via Advantage and Sequence-Weight Estimation

模型训练强化学习RLVRAgentic RL

摘要

群体相关策略优化依赖于奖励衍生优势和序列级似然权重,这两者都对局部异常值敏感。极端的奖励可能会削弱群体标准化后干净响应之间的对比度,而词元级别的对数比扰动可以改变序列权重和裁剪决策。我们推出了 RoVR-GSPO,这是一种双通道稳健优化器,可以分别解决这些故障模式。其奖励通道将稳健的参考估计与有界剩余信用相结合,而其比率通道则使用可微分的 SoftRoVR 聚合来构建稳健的序列权重。我们为这两个渠道提供稳定性和效率分析。数学推理、长上下文摘要和工具调用注释的实验显示出相对于 GSPO 的持续改进,而受控扰动研究表明对奖励污染和词元比率异常具有更强的鲁棒性。