论文
Influcoder:将解码器的梯度影响排名提取到编码器中进行数据归因
Influcoder: Distilling Decoders' Gradient Influence Rankings into an Encoder for Data Attribution
摘要
随着 LLM (大语言模型) 功能的增长,人们越来越倾向于通过过滤训练数据中的样本来管理高质量数据集。一般来说,数据归因 (DA) 方法旨在估计训练数据集中的各个样本如何预处理模型以生成某些输出。例如,人们可能会对训练 LLM 后数据中的哪些样本可能是有毒行为的来源感兴趣。许多方法通过影响函数的范式来量化这种调节。虽然该系列的方法在功能上很有效,但它们缺乏在大型数据集上实际实现所需的处理速度和存储紧凑性。我们提出了一种方法 Influcoder,作为一种快速且经济高效的大规模基于影响力的数据归因方法。