论文

DataDignity:大语言模型的训练数据归因

DataDignity: Training Data Attribution for Large Language Models

模型评测基准与评测资源

摘要

审计语言模型输出常需要超越判断正确性:审计者可能需要识别哪个源文档最可能支持回复中表达的知识。我们将其研究为精确溯源:给定提示、目标模型回复与候选语料,对最佳支持该回复的文档排名。我们引入FakeWiki:一个受控基准,含3,537篇伪造的维基百科式文章,设计上保留真值溯源同时削弱词汇捷径。FakeWiki包含QA探针、保源改写、回溯生成变体、保持主题相似但移除答案关键事实的困难反文档,以及五种查询条件:干净提示加四种越狱式变换。我们评估七个检索基线、免训练的激活引导检索融合方法SteerFuse,以及监督对比溯源排序器ScoringModel。ScoringModel把回复与文档特征映射进共享空间,用InfoNCE训练,负例含批内、检索挖掘与反文档。跨九个开放权重指令LLM与五种查询条件,ScoringModel把平均Recall@10从最强检索基线的35.0提升到52.2,无需推理时融合,并在45个模型×条件格中赢下41个。

DataDignity:大语言模型的训练数据归因:论文配图
图 1:DataDignity 概述。上图:FakeWiki 构造伪造的源文档、变体、反文档和转换后的查询。底部:ScoringModel 学习受监督的来源分数,而 SteerFuse 将激活空间证据与 SBERT 检索融合。