DUET:通过可验证的奖励优化强化学习的词元预算分配
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
摘要
具有可验证奖励的强化学习 (RLVR) 在每个训练步骤中生成数十万个词元,而部署生成在计算成本中占主导地位。总体 词元预算 可以通过两个主要维度进行控制:(i) 决定将采样轨迹分配给哪些提示,以及 (ii) 决定每次采样轨迹应持续多长时间。先前的工作通常一次仅控制这些维度中的一个。我们表明,在共享计算预算下联合调整这两个决策可以提高推理质量和挂钟训练时间。我们将此视图实例化为 \textbf{DU}al 控制的 tok\textbf{E}n alloca\textbf{T}ion (DUET),这是 GRPO 上的一个计算高效层,它使用提示信息量的轻量级预采样轨迹代理来设置每个提示接收的采样轨迹数量,以及具有重要性重新加权的标记门控中止规则以设置何时停止它们。在接受 MATH 训练的 Qwen3-1.7B 上,DUET 的表现优于全预算 GRPO 和其他三种预算感知基线方法。 DUET 的优势进一步推广到数学和编码领域的其他基准,并且与科学问答领域的最佳基准相当,同时还实现了 1.62倍$ 的挂钟加速。更值得注意的是,仅使用 50% 的 词元预算,DUET 在其全部预算下仍然优于所有基线方法,与全预算 GRPO 相比,实现了更高的 2.51倍 加速。我们在其他骨干网LLM上验证了DUET的高性能,包括Qwen3-4B和Llama-3.2-3B-Instruct。值得注意的是,随着预算收紧,DUET 与最强基线 \emph{ 之间的差距会扩大,这与随着计算量减少而高效方法以牺牲质量为代价的通常模式相反。更广泛地说,这些结果表明 DUET 预算感知控制策略不仅对于加速训练很有价值,而且对于提高学习信号的质量也很有价值。