论文
信息时间近端策略优化
Information-Time Proximal Policy Optimization
摘要
RLVR 极大地提高了 LLM 的推理能力。然而,现有方法通常通过逐个标记生成来参数化马尔可夫决策过程中的时间进程,尽管沿自回归轨迹的信息流高度不均匀。在本文中,我们提出了 InfoPPO,它使用信息密度而不是原始标记计数来重新参数化时间进程。这种重新参数化为时间信用传播和策略更新引入了一个共同的状态相关结构。 InfoPPO恢复了长域推理中非平凡贴现的有效性,保留了有效域收缩,同时避免了对长词元序列的终端监督的过度衰减。此外,信息时间策略改进分析自然会导致状态相关的更新约束,我们通过自适应裁剪来实现。通过使每个词元位置的裁剪阈值适应其相应状态的信息密度,该机制可以实现更有针对性的策略更新,同时保留近端控制。理论上,我们将绩效差异和政策改进分析扩展到信息时间 MDP,得出当政策变化受信息密度调节时的政策改进下限。我们通过将状态信息密度与本地政策运动联系起来,进一步将一般信息时间分析与实际的大语言模型政策优化联系起来,同时也为自适应更新机制提供理论基础。 Qwen3 模型的实验表明,在五个具有挑战性的竞赛式数学推理基准测试中,Qwen3 模型的表现始终优于竞争基准。 InfoPPO 还可以在词元时间 PPO 恶化的非平凡折扣设置下保持稳定的准确性和响应长度。