论文
DataDignity:大语言模型的训练数据归因
DataDignity: Training Data Attribution for Large Language Models
摘要
审计语言模型输出常需要超越判断正确性:审计者可能需要识别哪个源文档最可能支持回复中表达的知识。我们将其研究为精确溯源:给定提示、目标模型回复与候选语料,对最佳支持该回复的文档排名。我们引入FakeWiki:一个受控基准,含3,537篇伪造的维基百科式文章,设计上保留真值溯源同时削弱词汇捷径。FakeWiki包含QA探针、保源改写、回溯生成变体、保持主题相似但移除答案关键事实的困难反文档,以及五种查询条件:干净提示加四种越狱式变换。我们评估七个检索基线、免训练的激活引导检索融合方法SteerFuse,以及监督对比溯源排序器ScoringModel。ScoringModel把回复与文档特征映射进共享空间,用InfoNCE训练,负例含批内、检索挖掘与反文档。跨九个开放权重指令LLM与五种查询条件,ScoringModel把平均Recall@10从最强检索基线的35.0提升到52.2,无需推理时融合,并在45个模型×条件格中赢下41个。
