论文

GVPO++:面向LLM后训练与在线策略蒸馏的组方差策略优化

GVPO++: Group Variance Policy Optimization for LLM Post-Training and On-Policy Distillation

模型训练强化学习RLVR

摘要

后训练对提升大语言模型(LLM)的推理能力与任务专门知识至关重要。尽管GRPO等后训练方法近来进展显著,其对重要性采样的依赖所带来的训练不稳定性仍阻碍其实际部署。我们提出组方差策略优化(GVPO),一种将KL约束奖励最大化的解析解融入梯度加权方案的新型后训练方法。该表述具有直观解释:GVPO的梯度对应隐式奖励的中心距离与实际奖励的中心距离之间的均方误差。GVPO具有两大优势:(1)保证唯一最优解,精确对应KL约束奖励最大化目标;(2)支持灵活的采样分布而无需重要性采样。除一般后训练外,我们证明GVPO可自然扩展到在线策略蒸馏(OPD)。进一步,GVPO支持优化一大类扩展OPD目标,为多样目标设计提供有原则的基础。通过统一理论保证与实践适应性,GVPO为可靠且多能的LLM后训练与在线策略蒸馏确立了新范式。

GVPO++:面向LLM后训练与在线策略蒸馏的组方差策略优化:论文配图
图 1:GVPO 损失的三种等价表述提供了不同的解读:(A) 负对数似然视角强调 GVPO 无需重要性采样即可兼容多样的采样分布;(B) 均方误差视角揭示了 GVPO 独特的最优解,即在 KL 散度约束下同时最大化奖励;(C) 正则化视角展示了 GVPO 的隐式正则化项,有助于稳定的策略优化。为简洁起见,我们设超参数 β=1。