论文
DARTS:用于加速 LLM 强化学习的分布感知主动轨迹采样轨迹塑造
DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning
摘要
强化学习 (RL) 已成为提高模型能力的关键,但由于长尾响应长度分布而面临轨迹采样效率瓶颈。虽然现有的工作通过提示级尾部调度来减轻长尾的影响,但我们关注低效率的根源:分布本身。具体来说,我们以更细的粒度描述长尾分布,识别提示内的长尾,并揭示它们通常由无效的冗长内容组成。为了解决这个问题,我们提出了一种主动分布塑造的新范式,以将轨迹采样分布塑造得简洁和确定,从而从根本上解决尾部引起的开销。我们通过分布感知轨迹采样机制来实现这一点,该机制从每个提示的冗余探索空间中选择轨迹,以及自适应冗余分配方案以最大化成形效果和系统效率。实验表明,在不影响模型性能的情况下,与最先进的系统相比,速度显着提高了 1.77 倍。