论文
AIS:量化强化学习的自适应重要性采样
AIS: Adaptive Importance Sampling for Quantized RL
摘要
大语言模型 (LLM) 的强化学习 (RL) 主要由 rollout 生成成本主导,这促使使用低精度 rollout(例如 FP8)与 BF16 训练器配合使用,以提高吞吐量并减少内存压力。这引入了采样轨迹训练不匹配的情况,使策略梯度产生偏差,并可能导致训练在推理基准上彻底崩溃。我们表明,失配是非平稳的,并且是一把双刃剑:在训练早期,它提供了随机探索奖励,将梯度暴露给训练者采样不足的轨迹,但随着政策集中,同样的扰动会转变为不稳定的偏差来源。为了解决这个问题,我们提出了自适应重要性采样(AIS),这是一种校正框架,可以按批次调整其干预强度。 AIS 将三种实时诊断(即权重可靠性、发散严重性和方差放大)结合到单个混合系数中,该混合系数在未校正和完全重要性加权的梯度之间进行插值,抑制失配的不稳定成分,同时保留其探索性优势。我们将 AIS 集成到 GRPO 中,并在基于扩散的 LLaDA-8B-Instruct 和自回归 Qwen3-8B 和 Qwen3.5-9B 上跨数学推理和规划基准对其进行评估。 AIS 在大多数任务上与 BF16 基线相匹配,同时保留 FP8 1.5 至 2.76 倍的采样轨迹加速。