论文

从重新加权到重写:解锁影响样本对训练数据归因的干预效果

From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data Attribution

模型训练合成数据

摘要

训练数据归因(TDA)旨在识别塑造模型行为的训练示例,但其干预价值取决于选择哪些示例以及如何修改它们。影响函数 (IF) 估计无穷小重新加权下的行为变化,但 IF 选择的示例通常比传统基于权重的干预下的随机选择优势有限。这就提出了一个问题:有影响力的例子是否缺乏干预价值,或者重新加权是否未能实现其行为杠杆作用。我们引入影响引导的响应重写,它使用IF来识别干预目标,并用行为一致或行为反对的监督替换其响应,同时保持指令固定。在四个开放权重 LLM 中,我们使用认知弃权作为我们的主要测试平台,对相同影响选择的示例进行重写和重新加权进行比较。重写响应会产生更强烈、更持久和双向的行为转变,而重新加权相同的示例会产生微弱且不一致的效果。进一步的分析表明,影响选择的示例比替代选择器提供了更大的重写杠杆,而更改仍然集中在目标相关的行为上。同样的定性对比也延伸到了安全拒绝。这些结果将影响力估计捕获的局部重新加权效应与他们确定的示例的更广泛的干预杠杆区分开来,激发了对 TDA 方法的干预意识评估。