论文
解构离策略比率:面向异步强化学习的熵缩放信任域
Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning
摘要
异步强化学习(RL)通过将 rollout 生成与策略优化重叠来加速大语言模型(LLM)后训练,但由此产生的陈旧离策略数据会破坏优化稳定性,最终导致策略崩溃。现有方法通常仅根据重要性比率的幅值来保留或丢弃 token,并在所有 token 位置上统一施加相同阈值。在本工作中,我们揭示重要性比率的自然尺度随 token 熵发生系统性变化。在异步动态下,这种熵-比率缩放导致两种截然不同的现象:在低熵处,固有的训练-推理差异被急剧放大为显著的采样噪声;在高熵处,执行过程中的权重更新会自然引发明显的、合理的探索性偏离。因此,仅基于幅值的修正会在无意中放行被放大的噪声,同时严格屏蔽掉由在途更新触发的必要探索。为解决这一问题,我们提出熵缩放信任域(Entropy-Scaled Trust Region, ESTR),按局部熵缩放每个 token 的离策略偏离,无需辅助前向传播或显式版本切换检测。在长时程智能体任务与数学推理基准上,ESTR 持续优于现有异步方法,并取得最佳的训练-推理一致性。它在 BrowseComp-Plus 上达到 $37.34$ avg@1,在多轮 GSM8K 上达到 $95.69$,在匹配同步 GRPO 的同时实现 $2.6 imes$ 加速。
