论文

COPC:异步LLM强化学习的耦合离策略修正

COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning

模型训练智能体系统AI 基础设施强化学习Agent 工具调用分布式训练基础设施

摘要

异步强化学习将Rollout生成与优化解耦,加速大语言模型后训练,但也会使用过时轨迹进行训练。已有方法主要在Actor目标中控制重要性比,以修正Token级策略不匹配。我们证明,仅进行这种策略侧修正并不足够:优势估计也会继承行为策略续跑造成的不匹配,我们称之为“优势陈旧性”。针对一般的双通道Actor更新,我们推导精确的偏差和方差分解,揭示策略权重误差与优势估计误差之间不可分离的耦合:两者交互产生乘性偏差项,而策略权重的平方会放大梯度方差中的优势不确定性。因此,我们提出策略侧和优势侧修正应协调进行的假设,并引入耦合离策略修正(COPC)。这一Actor-Critic方法结合Token级比率掩码与TD残差的双侧截断比率加权,用于回报和优势估计。在不同陈旧程度下联合扫描参数,支持了上述假设:一个修正参数的作用依赖另一个参数,并可能随其变化而反转。在工具集成数学推理和搜索任务上,COPC取得论文所报告的最高表现,在每种设置中均超过所报告的最强异步基线。它还提供较宽的高性能参数区间,并改善训练稳定性。在搜索任务中,COPC全程保持稳定,而多数受测异步基线在训练后期崩溃。即使策略滞后64步,这些收益仍然存在。相比异步PPO,COPC只增加很小的单步耗时;相比同步PPO,仍保留1.7倍的单步加速。

COPC:异步LLM强化学习的耦合离策略修正:论文原图
图 1:AIME 2025 在联合策略侧和优势侧校正扫描下在陈旧水平 s∈{8,12,16}s\in\{8,12,16\} 下的平均 avg@32 准确率。