论文
大语言模型 中通过双向梯度优化的数据归因
Data Attribution in Large Language Models via Bidirectional Gradient Optimization
摘要
大语言模型 (LLM) 越来越多地部署在不同的应用程序中,引发了治理、问责制和数据来源方面的关键问题。了解哪些训练数据对模型输出影响最大仍然是一个基本的开放问题。我们通过扩展逆公式,通过自回归 LLM 的训练数据归因 (TDA) 来应对这一挑战:如果模型在训练期间看到了生成的输出,训练数据将受到怎样的影响?我们的方法对生成的文本样本使用双向梯度优化(梯度上升和下降)来扰乱基本模型,并测量训练样本中损失的变化。我们的框架支持任意数据粒度的归因,从而实现事实归因和风格归因。我们根据已知数据集的预训练模型的基线评估我们的方法,并表明它优于之前在影响力指标方面的工作,从而增强了模型的可解释性,这是负责任的人工智能系统的基本要求。