论文
太正确而难以学习:饱和推理数据的强化学习
Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
摘要
强化学习 (RL) 增强了 LLM 推理,但随着模型规模的扩大,出现了一个悖论:强大的基础模型饱和了标准基准(例如数学),产生了正确但同质的解决方案。在这种环境中,失败案例的缺乏会导致群体相关算法(例如 GRPO)中的优势信号消失,从而导致策略陷入模式崩溃。为了解决这个问题,我们提出了约束均匀 Top-K 采样(CUTS),这是一种强制结构保留探索的无参数解码策略。与遵循模型偏差的标准采样不同,CUTS 通过从受约束的高置信度候选中均匀采样来平坦化局部优化景观。我们将其集成到 Mixed-CUTS 中,这是一个协同利用和探索性轨迹采样的训练框架,以放大组内的优势差异。 Qwen3 模型的实验表明,我们的方法可以防止策略退化并显着提高域外泛化能力。值得注意的是,与标准 GRPO 相比,Mixed-CUTS 在具有挑战性的 AIME25 基准上将 Pass@1 准确率提高了 15.1%,这证实了保持语义流形内的多样性对于严格推理至关重要。