论文
ASymPO:没有行为信息的异步 LLM 后训练 的非对称规模策略优化
ASymPO: Asymmetric-Scale Policy Optimization for Asynchronous LLM Post-Training Without Behavior Information
摘要
异步强化学习可以通过将响应生成与策略优化解耦来提高语言模型 后训练 吞吐量,但过时的响应会引入分布漂移。标准行为校正方法通过行为策略概率、重要性比或裁剪来控制这种漂移,这需要跨采样和学习器系统进行词元对齐、版本化和数字一致的行为日志概率。我们询问是否可以仅使用当前策略概率来稳定异步组相关 RL。我们确定了一种规模不平衡失效模式:当在当前策略下评估过时的响应时,正负损失项可能出现在不同的负对数概率尺度上,因此零和优势不再意味着平衡的损失贡献。我们提出非对称规模策略优化(ASymPO),它通过当前平均词元负对数概率来标准化每个响应的词元损失。 ASymPO 不需要行为策略概率,恢复响应级别的零和平衡,并保留非零学习信号。我们还引入了缩放策略优化(SPO),这是一个固定的负缩放基线,并评估异步数学推理 后训练 中的仅当前策略目标。