论文
用于离散策略优化的指导对比词元贡献分配
Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization
摘要
基于群体优势的强化学习方法,例如 GRPO 和 DAPO,在数学推理和文本到图像生成等不同领域表现出了强大的性能。然而,他们对样本级奖励的依赖引入了一个关键限制,因为所有词元的统一贡献分配无法捕获细粒度的 词元级 贡献。为了解决这个问题,我们提出了指导对比策略优化(GCPO),这是一种新颖的算法,通过对比正面和负面提示下的模型预测来实现每个词元的贡献分配。 GCPO 不是统一广播样本级别的优势,而是分配与这些对比预测之间的差异成比例的 词元级 优势,从而允许更精确和信息丰富的学习信号。根据经验,我们发现 GCPO 强调语义相关区域,例如在文本到图像生成中与文本提示对齐的视觉区域,以及思维链任务的推理轨迹中的关键关键字。通过大量的实验,GCPO 在文本到图像生成和思想链推理基准方面始终优于 GRPO 和 DAPO 基线,证明了其作为离散策略学习的通用且可扩展的优化策略的有效性。