论文
GVPO++:面向LLM后训练与在线策略蒸馏的组方差策略优化
GVPO++: Group Variance Policy Optimization for LLM Post-Training and On-Policy Distillation
摘要
后训练对提升大语言模型(LLM)的推理能力与任务专门知识至关重要。尽管GRPO等后训练方法近来进展显著,其对重要性采样的依赖所带来的训练不稳定性仍阻碍其实际部署。我们提出组方差策略优化(GVPO),一种将KL约束奖励最大化的解析解融入梯度加权方案的新型后训练方法。该表述具有直观解释:GVPO的梯度对应隐式奖励的中心距离与实际奖励的中心距离之间的均方误差。GVPO具有两大优势:(1)保证唯一最优解,精确对应KL约束奖励最大化目标;(2)支持灵活的采样分布而无需重要性采样。除一般后训练外,我们证明GVPO可自然扩展到在线策略蒸馏(OPD)。进一步,GVPO支持优化一大类扩展OPD目标,为多样目标设计提供有原则的基础。通过统一理论保证与实践适应性,GVPO为可靠且多能的LLM后训练与在线策略蒸馏确立了新范式。
