论文

基于梯度的数据归因方法中形式重于内容

Form Over Content In Gradient-Based Data Attribution Methods

模型评测评测方法与指标

摘要

使用梯度相似度的数据归因方法被广泛用于分析和选择大型语言模型的训练数据,但梯度相似度实际衡量的是什么仍存在争议。一些人将其解释为识别与任务相关的技能,而其他工作则报告说表面形式是主要因素。我们通过独立地改变任务和答案格式来解决监督微调示例的争论。具体来说,我们以不同的答案格式呈现基准,以便数据集可以共享没有格式的任务或没有任务的格式。我们发现梯度对齐遵循答案格式,因为共享答案格式的基准对强烈对齐(接近 0.4 的去衰减余弦),而使用不同答案格式类呈现的相同基准则显示没有对齐(接近 0.0)。我们证明了这种顺序从最早的训练前检查点一直到训练后,并且跨模型规模和系列。然后,我们分析了 LESS(一种用于指令调整的基于梯度的数据选择方法)发布的选择,发现每个目标的选择过度代表了目标自己的答案格式。因此,我们证明基于梯度的归因方法比任务语义更多地跟踪格式相似性,这意味着这些方法以及梯度的语义解释应该在答案格式和任务独立变化的数据上进行测试,以获得更大的鲁棒性和可靠性。