论文

打破赢者通吃:协作式策略优化改进多样化LLM推理

Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning

模型训练强化学习RLVR

摘要

带验证器的强化学习(RLVR)已成为改进LLM推理的核心范式,然而GRPO等流行的组级优化算法常遭受探索坍缩之苦:模型过早收敛于少数高得分的模式,缺乏探索新解的能力。近期的努力试图通过加入熵正则化或多样性奖励来缓解这一问题。但这些方法并未改变赢者通吃的本质:各rollout仍在为个体优势而竞争,而非为最大化全局多样性而协作。在本工作中,我们提出组协作策略优化(GCPO),将训练范式从rollout竞争转向团队协作。具体而言,GCPO用团队级的贡献归因取代独立的rollout打分:一个rollout的奖励取决于它对团队有效解覆盖度的贡献大小,而非其个体准确率。该覆盖度被描述为奖励加权语义嵌入上的行列式体积,其中只有正确且非冗余的rollout对该体积有贡献。在优势估计时,GCPO依据每个rollout对团队的平均边际贡献,将团队集体奖励重新分配给各个rollout。这种协作式训练范式将优化引导至非冗余的正确推理路径。在多个推理基准上的实验表明,GCPO在推理准确率和解的多样性上均显著优于现有方法。代码将发布于 https://github.com/bradybuddiemarch/gcpo。

打破赢者通吃:协作式策略优化改进多样化LLM推理
图 1:基于组的优化策略的比较。左:GRPO 仅针对个体正确性进行优化,通常会导致探索崩溃。中:多样性正则化方法为奖励增加了多样性奖励,但这只会产生已经成功的推理路径的表面变化。右:我们的 GCPO 考虑每次部署对小组解决方案覆盖范围的边际贡献,激励不同的正确推理路径。