论文

从有价值的采样轨迹中学习:基于 PPO 的数据归因 LLM 后训练

Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training

模型训练强化学习

摘要

传统的 RL 算法(例如近端策略优化 (PPO))通常在整个轨迹采样缓冲区上进行训练,并假设所有生成的片段都提供有益的优化信号。然而,这些任务交互经常包含嘈杂或不忠实的推理,这可能会降低模型性能并减慢训练速度。在本文中,我们提出了 \textbf{Influence-Guided PPO (I-PPO)},这是一种将数据归因集成到 RL 后训练 循环中的新颖框架。通过使用基于梯度的近似计算每个情节的影响力分数,I-PPO 可以识别并消除与验证梯度相反的情节。我们的实验表明,I-PPO 始终优于 SFT 和 PPO 基线。我们表明,我们的过滤过程充当了一种内在的早期停止机制,提高了训练效率,同时有效减少了不忠实的 CoT 推理。