论文

STRIDE:通过子集扰动的稀疏恢复来训练数据归因

STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations

模型评测模型行为与机制分析

摘要

训练数据归因 (TDA) 旨在将模型的预测追溯到其训练数据。 TDA 的黄金标准依赖于因果干预,观察添加或删除数据时模型如何变化,但重复重新训练对于 大语言模型 (LLM) 来说在计算上具有挑战性。因此,大多数方法使用梯度在参数空间中近似这种效果。然而,跟踪数十亿个参数的梯度不仅成本高昂,而且依赖于局部近似。在这项工作中,我们提出了一个转变:我们不是估计参数变化,而是对激活空间中训练数据的功能效果进行建模。我们引入了 STRIDE(基于转向的训练数据影响分解),该框架本着压缩感知的精神将 TDA 表述为稀疏恢复问题。 STRIDE 学习轻量级的“转向算子”,模仿数据子集训练引起的行为转变。通过测量这些算子如何干扰测试预测,我们通过稀疏线性分解恢复单个训练示例的影响。 STRIDE 实现了 LLM 预训练 归因的最先进技术,同时比以前的技术快一个数量级($13\times$)。我们通过数据选择、数据污染和定性分析等下游应用进一步验证其实用性。