论文
DCRL:通过政策奖励流形对齐来解耦和耦合强化学习
DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment
摘要
强化学习(RL)已成为提高大型语言模型(LLM)推理能力的关键范例。然而,现有的奖励系统,例如基于规则和基于奖励模型的奖励系统,经常表现出优化不稳定和奖励作弊等问题。在这项工作中,我们从几何角度重新审视大语言模型的一般推理,将其概念化为由三个相互依赖的子流形组成的耦合流形:逻辑演绎、评估和表示。基于这个角度,强化学习中的响应生成可以解释为与评估流形的解耦过程,而奖励估计则对应于与逻辑演绎流形的解耦过程。基于规则和奖励模型的强化学习系统的局限性可以在几何上解释为强化学习过程中政策奖励流形的不匹配。为了解决上述失调问题,我们提出了解耦与耦合强化学习(DCRL)框架,该框架包含两个关键组成部分:(1)基于三段论逻辑的提示进化机制,动态细化奖励规则以增强奖励流形的表达能力; (2)政策-奖励重新耦合机制,联合更新奖励和政策模型,确保评估一致并减少训练期间的多种不匹配。跨多个推理领域的理论分析和广泛实验表明,DCRL 始终优于基于规则和奖励模型的基线。值得注意的是,在 DCRL 下训练的 Qwen3-4B 模型超越了 Qwen3-32B 基线,并接近 Qwen3-235B 模型的性能,突出了 RL 的卓越有效性和泛化性。