论文

控制多样化强化 微调:解耦 RL 的共享控制瓶颈 后训练

Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

模型训练强化学习

摘要

强化学习 后训练 解锁 LLM 中的复杂推理。然而,基准分数只揭示了模型是否有所改进,而不是模型内部发生了什么变化,也没有揭示模型如何在任务之间分配有限的能力。具有代表性的可解释性系列将 RL 微调 的成功归因于更强、更多样化的电路激活。我们通过将激活与控制分开来挑战这个以激活为中心的账户:激活的电路不需要控制 后训练 奖励增益。采用代谢控制分析,我们定义了 后训练 控制系数来衡量组件对奖励增益的控制,并按任务系列将这些系数排列成控制矩阵,并与激活幅度矩阵配对。我们将跨任务控制集中度称为共享控制瓶颈,将激活和控制集中度之间的差异称为激活控制差距。这表明高度共享的激活可以与特定任务的控制共存,而小差距表明控制已经崩溃到共享方向并失去了任务特异性。为了减少这种崩溃,我们使用共享控制瓶颈对 后训练 损失进行正则化,并提出控制多样化强化 微调 (CD-RFT)。精确的正则化梯度需要与闪光注意力不兼容的二阶自动微分,因此我们推导出最坏情况开销低于百分之八的一阶代理。在 Qwen2.5-7B 上,CD-RFT 实现了最大的控制解耦,并在数学、代码和逻辑方面比匹配的 GRPO 提高了多任务能力。 no-KL 变体在 pass@1 上领先,而 KL 惩罚变体在大 k pass@k 覆盖率上领先,否则 KL 会降低覆盖率。总之,这些结果表明共享控制瓶颈既是机械诊断又是训练正则器,并且控制解耦和能力增益转移到 Llama-3.2-3B。