论文
TARPO:通过动作路由策略优化进行词元明智的潜在显式推理
TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization
摘要
潜在推理已成为 大语言模型 (LLM) 中离散思想链 (CoT) 的有前景的替代方案,通过连续表示操作实现更具表现力的推理。然而,连续表示固有的确定性限制了强化学习(RL)中的策略探索。为了解决这个问题,我们提出了 TARPO(通过动作路由策略优化进行词元明智的潜在显式推理),这是一种纯 RL 框架,可以在每一步中自适应地在离散词元生成和连续潜在推理之间切换。 TARPO 引入了一个轻量级的动作头路由器,它观察当前的隐藏状态并从二进制模式选择空间中采样路由决策,从而保留了词汇表中离散词元采样的随机性。 LLM骨干网和路由器通过共享组相对优势信号进行端到端联合优化。跨 Qwen2.5(从 1.5B 到 7B)和 Llama-3.1-8B 主干网的广泛实验表明,TARPO 在不同的基准测试中始终优于现有的显式和潜在推理 RL 基线。进一步的分析表明,TARPO 学习自适应词元切换行为,同时保持稳定的训练动态。我们的代码可在 https://github.com/NKU-LITI/TARPO-master 获取。