论文
从 $P(y|x)$ 到 $P(y)$:研究预训练空间中的强化学习
From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space
摘要
虽然具有可验证奖励的强化学习 (RLVR) 通过优化条件分布 P(y|x) 显着增强了 LLM 推理,但其潜力从根本上受到基础模型现有输出分布的限制。优化预训练空间中的边际分布 P(y) 通过编码推理能力和保留广泛的探索能力来解决这一瓶颈。然而,传统的 预训练 依赖静态语料库进行被动学习,导致分布变化,阻碍有针对性的推理增强。在本文中,我们介绍了 PreRL(预训练空间 RL),它将奖励驱动的在线更新直接应用于 P(y)。我们从理论上和经验上验证了 log P(y) 和 log P(y|x) 之间的强梯度对齐,将 PreRL 确立为标准 RL 的可行替代品。此外,我们还发现了一个关键机制:PreRL 中的负样本强化 (NSR) 是异常有效的推理驱动器。 NSR-PreRL 快速修剪不正确的推理空间,同时刺激内源性反思行为,将转换和反思思维分别增加 14.89 倍和 6.54 倍。利用这些见解,我们提出了双空间 RL (DSRL),这是一种策略轮回策略,它使用 NSR-PreRL 初始化模型以扩展推理范围,然后再过渡到标准 RL 进行细粒度优化。大量实验表明,DSRL 始终优于强大的基线,证明训练前空间修剪有效地将策略引向精确的正确推理子空间。