论文
打破赢者通吃:协作式策略优化改进多样化LLM推理
Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning
摘要
带验证器的强化学习(RLVR)已成为改进LLM推理的核心范式,然而GRPO等流行的组级优化算法常遭受探索坍缩之苦:模型过早收敛于少数高得分的模式,缺乏探索新解的能力。近期的努力试图通过加入熵正则化或多样性奖励来缓解这一问题。但这些方法并未改变赢者通吃的本质:各rollout仍在为个体优势而竞争,而非为最大化全局多样性而协作。在本工作中,我们提出组协作策略优化(GCPO),将训练范式从rollout竞争转向团队协作。具体而言,GCPO用团队级的贡献归因取代独立的rollout打分:一个rollout的奖励取决于它对团队有效解覆盖度的贡献大小,而非其个体准确率。该覆盖度被描述为奖励加权语义嵌入上的行列式体积,其中只有正确且非冗余的rollout对该体积有贡献。在优势估计时,GCPO依据每个rollout对团队的平均边际贡献,将团队集体奖励重新分配给各个rollout。这种协作式训练范式将优化引导至非冗余的正确推理路径。在多个推理基准上的实验表明,GCPO在推理准确率和解的多样性上均显著优于现有方法。代码将发布于 https://github.com/bradybuddiemarch/gcpo。
