论文

LEPO:大语言模型 的潜在推理策略优化

LEPO: Latent Reasoning Policy Optimization for Large Language Models

模型训练强化学习

摘要

最近,大语言模型 (LLM) 中引入了潜在推理,以利用连续空间内的丰富信息。然而,如果没有随机采样,这些方法不可避免地会陷入确定性推理,无法发现多样化的推理路径。为了弥补这一差距,我们通过 Gumbel-Softmax 将可控随机性注入潜在推理中,恢复 LLM 的探索能力并增强其与强化学习(RL)的兼容性。在此基础上,我们提出了 \textbf{\underline{L}}atent R\textbf{\underline{e}}asoning \textbf{\underline{P}}olicy \textbf{\underline{O}}ptimization~(\textbf{LEPO}),这是一种将强化学习直接应用于连续潜在表示的新颖框架。具体来说,在轨迹采样阶段,LEPO 保持随机性以实现不同的轨迹采样,而在优化阶段,LEPO 为潜在表示和离散词元构建统一的梯度估计。大量实验表明,LEPO 在离散和潜在推理方面明显优于现有的 RL 方法。