论文
超越模仿:面向主动潜在规划的强化学习
Beyond Imitation: Reinforcement Learning for Active Latent Planning
摘要
针对高效且稠密的思维链(CoT)推理,潜在推理方法微调大语言模型(LLM),以连续潜在token替代离散语言token。这些方法相比传统语言CoT推理消耗更少token,并具备在稠密潜在空间中规划的潜力。然而,当前的潜在token通常基于模仿语言标签进行监督。考虑到一个问题可能存在多个等价但多样的CoT标签,被动模仿其中任意一个可能导致次优的潜在token表示与潜在推理策略,削弱潜在规划能力,并造成训练与测试之间的明显差距。在本工作中,我们强调在潜在token表示空间上进行主动规划对获得最优潜在推理策略的重要性。为此,我们提出主动潜在规划方法(ATP-Latent),它将潜在token的监督过程建模为条件变分自编码器(VAE)以获得更平滑的潜在空间。此外,为促成最合理的潜在推理策略,ATP-Latent引入带辅助一致性奖励的强化学习(RL),该奖励基于潜在token的VAE解码内容之间的一致性计算,从而实现有引导的RL过程。在LLaMA-1B上的实验中,ATP-Latent在四个基准上相比先进基线取得+4.1%准确率与-3.3% token。代码见 https://github.com/zz1358m/ATP-Latent-master。
