论文

异步代理强化学习中缺少旧的 logits:离策略 校正的语义不匹配和修复方法

Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

模型训练强化学习

摘要

异步强化学习通过将样本生成与策略优化解耦来提高 大语言模型 代理的采样轨迹吞吐量,但它也引入了 PPO 式 离策略 校正的关键故障模式。在异构训练系统中,理想情况下,总重要性比应分解为两个语义上不同的因素:一个 \emph{training--inference diffrepancy term},它在同一行为策略版本上对齐推理端和训练端分布;以及一个 \emph{policy-staleness term},它限制从历史策略到当前策略的更新。我们表明,具有延迟更新和部分采样轨迹的实际异步管道通常会丢失所需的历史训练端 logits 或旧的 logits。这个缺失的旧 logits 问题将差异修复与陈旧校正纠缠在一起,破坏了解耦校正的预期语义,并使剪切和掩蔽阈值相互作用不良。为了解决这个问题,我们研究了精确和近似校正路线。我们提出了三种精确的旧 logits 获取策略:基于快照的版本跟踪、专用的旧 logits 模型以及通过部分采样轨迹中断进行同步,并比较了它们的系统权衡。从近似校正的角度来看,当无法以低成本恢复确切的旧logits时,我们专注于通过更合适的近似策略保留解耦校正的好处,而不产生额外的系统开销。根据此分析,我们采用了改进的 PPO-EWMA 方法,该方法在训练速度和优化性能方面均取得了显着的提升。