论文
SetPO:面向保持多样性 LLM 推理的集合级策略优化
SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning
摘要
可验证奖励的强化学习在提升大语言模型(LLM)推理性能方面已显示出显著成效,尤其在数学任务上。然而,这类改进往往伴随结果多样性的下降,模型将概率质量集中于狭窄的解集合。受收益递减原理启发,我们引入一个定义在采样轨迹之上、使用核化相似性的集合级多样性目标。我们的方法为每条采样轨迹推导留一边际贡献,并将该目标作为即插即用的优势整形项融入策略优化。我们进一步在分布扰动框架内考察单条轨迹对语言模型多样性的贡献。这一分析从理论上证实了单调性性质,证明更稀有的轨迹对全局多样性的边际贡献始终更高。在一系列模型规模上的大量实验证明了所提算法的有效性,在多个基准的 Pass@1 与 Pass@K 上持续超越强基线。
