论文
QaRL:Rollout-Aligned Quantization-Aware RL,用于训练下快速稳定的训练——推理不匹配
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
摘要
大语言模型 (LLM) 强化学习 (RL) 管道通常会因轨迹生成而遇到瓶颈,导致端到端训练变慢。最近的工作通过运行量化轨迹采样来加速解码(这是 RL 循环中最昂贵的阶段)来缓解这一问题。然而,这些设置通过放大训练-推理差距来破坏优化的稳定性:轨迹采样以低精度运行,而学习更新以全精度计算。为了应对这一挑战,我们提出了 QaRL(Rollout Alignment Quantization-Aware RL),它将训练端向前与量化的 rollout 对齐,以最大限度地减少不匹配。我们进一步确定了量化采样轨迹中的失败模式:长格式响应往往会产生重复的、乱码的标记(错误标记)。为了缓解这些问题,我们引入了 TBPO(信任带策略优化),这是一个序列级目标,对负样本进行双重裁剪,旨在将更新保持在信任区域内。在针对数学问题的 Qwen3-30B-A3B MoE 上,QaRL 的性能比量化轨迹采样训练高出 +5.5,同时提高了稳定性并保留了低位吞吐量优势。