论文

超越模式坍缩:面向多样化推理的分布匹配

Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

模型训练强化学习RLVR

摘要

诸如GRPO之类的在线策略强化学习方法饱受模式坍缩之苦:解的多样性下降,一旦发现某个解,概率质量便集中于该单解,并停止探索备择策略。我们证明这源于反向KL最小化的寻模(mode-seeking)行为:它强化最先发现的高奖励轨迹,而不是在多个多样解上维持一个分布。我们提出DMPO(Distribution-Matching Policy Optimization,分布匹配策略优化),通过有原则地近似前向KL最小化来防止模式坍缩。DMPO在采样轨迹上构建与奖励成正比的组级目标分布,然后将策略分布对齐到该目标。这提供了覆盖模式(mode-covering)的行为,而无需从难以处理的全局目标分布中采样,从而在整个训练过程中保持持续探索。我们在NP难组合优化上验证DMPO,该问题存在指数级数量的可行解但只有少数接近最优,是评估探索能力的理想试验台。DMPO在文本版NP-Bench上取得43.9%的质量比(GRPO为40.1%),在视觉版NP-Bench上取得43.1%(GRPO为38.4%),分别呈现9%和12%的相对提升。这些提升可泛化到数学推理(+2.0%)与域外任务(+2.3%),表明保持多样性的训练能增强跨模态的通用推理能力。我们的工作确立了分布匹配作为防止在线策略RL模式坍缩的一种实用且有原则的方法,持续的质量提升证明了在多样推理任务上探索的可持续性。

超越模式坍缩:面向多样化推理的分布匹配:论文配图
图 2:MM-NP-Bench 概述。用于评估优化推理探索的多模态基准。 MM-NP-Bench 具有 10 个 NP 难任务,具有双指标评估(成功率和质量比),使模式崩溃可观察到。完整的基础设施包括参数生成器、基于规则的验证器和启发式求解器,支持评估和 RLVR 训练。