论文
跳过您可以预测的内容:用于策略优化的预测性重新定位,以实现高效的 LLM 训练
Skip What You Can Predict: Predictive Repositioning for Policy Optimization for Efficient LLM Training
摘要
具有可验证奖励的强化学习(RLVR)可以提高 大语言模型 的推理能力,但在同一个 rollout 批次上重复更新策略的成本很高:每次额外的更新都需要另一次向后传递,而多步骤方法需要支付所有中间优化步骤的费用。我们引入了策略优化的预测重新定位(PrePO),它使用两个观察到的优化器转换来估计同一批次优化轨迹上的更远的点,向该点移动一半,评估那里的原始目标,并应用校正更新。这为 PrePO 提供了固定的主动成本,该成本不会随着虚拟优化深度而增长。我们的分析给出了 AdamW 和 Muon 的有限范围误差范围,并表明足够准确的端点估计保留了平滑梯度下降的通常下降和收敛行为。在 RLVR 实验中,与相应的基线相比,PrePO 以更少的优化步骤和更低的挂钟时间达到了匹配的性能目标。我们进一步在不同数据集上评估监督 微调 中的相同更新机制,表明其使用不限于原始 RLVR 设置。总之,这些结果表明 PrePO 提供了一种实用的机制,用于近似重复的同批次优化,同时避免显式执行每个中间更新的成本。