论文

BehaviorTrace:在线强化学习的训练轨迹归因评测

Which Rollout Taught It That? BehaviorTrace and the Limits of Training-Data Attribution in Online RL

模型评测模型训练强化学习评测方法与指标模型行为与机制分析

摘要

当强化学习教授语言模型一种新行为时,我们能找到教授它的训练展示吗?当归因方法说可以时,我们如何知道答案是真实的?我们使用 GRPO 使用已知原因的植入行为来研究这两个问题。我们发布了BehaviorTrace,这是一个开放的评估工具,它结合了全梯度草图、植入行为设置以及对梯度大小、流畅性、净空以及种子和生成绘制之间的变化的控制。在 Qwen2.5-1.5B 的三个种子中,大部分明显的归因信号来自混淆。仅按梯度大小对训练步骤进行排序(没有行为目标)的控制达到了 4.2 到 4.5 倍的机会,并且在三个种子中的两个上匹配或击败了最佳目标估计器。在饱和检查点,模型流畅度至少可以像我们与之比较的每个梯度方法一样预测行为标签。一旦流畅度得到控制,每次Rollout的结果都会从种子到种子、从一代抽签到下一代抽签发生变化,因此单次运行无法解决问题 问题。一个信号确实保留了所有三颗种子。触发Token的梯度与实际发生行为时构建的目标一致。我们将这些发现转化为评估强化学习归因的清单。我们测试现有的估计器,包括 GAS(重整化 TracInCP)和 TRAK 式估计器,并且不提出新的估计器。

BehaviorTrace:在线强化学习的训练轨迹归因评测:论文原图
图 1:|GT|\lvert\mathrm{GT}\rvert 处的步级精度(平局感知)。左:总体;每个目标估计器和无目标范数控制都远高于机会,但低于训练与未训练的上限,而本地缓冲区为零且随机是机会。右图:在训练的窗口内,每个条形图都显示相对于该种子自己的机会(零是机会);每种方法(包括随机方法)的概率都在大约 0.03 以内,而可实现的余量仅为 0.11 左右(上限减去概率,虚线),并且随机的条形图(+0.003+0.003 到 +0.010+0.010)显示了噪声的大小。