论文

陈旧但稳定:用于稳定异步强化学习的陈旧自适应信任区域

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

模型训练强化学习

摘要

异步强化学习通过将部署生成与优化分离来提高吞吐量,但由此产生的陈旧性是不可避免的副产品,并由策略滞后、引擎延迟和专家混合路由共同加剧。从信赖域的角度来看,这种不匹配至关重要:在有限范围的改进界限中,训练推理发散控制近似误差,而 PPO 裁剪仅对采样的向外更新进行门控,因此充当采样代理而不是全策略约束。因此,高陈旧性更新可以在陈旧采样轨迹最重要的异步机制中保持弱控制。我们引入了陈旧性自适应信任区域(SAT),它使用分离的采样对数比作为实用的陈旧性代理,通过基于陈旧性的核函数缩放来识别每个批次中的高失配尾部,并使用有效收缩因子仅收缩标称 PPO 区间的符号选择端点。这种设计保留了普通词元的基线行为,同时使更新在新拦截的向外频带上更加保守。我们在基于 Qwen3-30B-A3B-Base 构建的完全解耦的异步强化学习设置中评估 SAT,利用 SGLang 作为推理引擎,利用 Megatron 作为训练管道。在此设置中,SAT-GSPO w/ R3 达到了最佳观察到的 AIME24 avg@8,在滞后 1 时达到 35.83,在滞后 8 时达到 34.79,而 SAT-GSPO 在滞后 1 时达到 34.17。更广泛地说,结果表明将剪辑间隔与观察到的陈旧异质性对齐是稳定所报告的异步状态的有效方法。