论文
BehaviorTrace:在线强化学习的训练轨迹归因评测
Which Rollout Taught It That? BehaviorTrace and the Limits of Training-Data Attribution in Online RL
摘要
当强化学习教授语言模型一种新行为时,我们能找到教授它的训练展示吗?当归因方法说可以时,我们如何知道答案是真实的?我们使用 GRPO 使用已知原因的植入行为来研究这两个问题。我们发布了BehaviorTrace,这是一个开放的评估工具,它结合了全梯度草图、植入行为设置以及对梯度大小、流畅性、净空以及种子和生成绘制之间的变化的控制。在 Qwen2.5-1.5B 的三个种子中,大部分明显的归因信号来自混淆。仅按梯度大小对训练步骤进行排序(没有行为目标)的控制达到了 4.2 到 4.5 倍的机会,并且在三个种子中的两个上匹配或击败了最佳目标估计器。在饱和检查点,模型流畅度至少可以像我们与之比较的每个梯度方法一样预测行为标签。一旦流畅度得到控制,每次Rollout的结果都会从种子到种子、从一代抽签到下一代抽签发生变化,因此单次运行无法解决问题 问题。一个信号确实保留了所有三颗种子。触发Token的梯度与实际发生行为时构建的目标一致。我们将这些发现转化为评估强化学习归因的清单。我们测试现有的估计器,包括 GAS(重整化 TracInCP)和 TRAK 式估计器,并且不提出新的估计器。
