论文
OriginBlame:AI训练数据集的记录级与token级数据溯源
OriginBlame: Record- and Token-Level Data Provenance for AI Training Datasets
摘要
当数据贡献者请求删除时,模型训练方面临实际缺口:遗忘算法需要遗忘集,但没有工具能定位哪些训练记录属于给定作者。既有溯源系统在文件或数据集层面运作,迫使灾难性的过度删除。我们提出ob:一个记录级与token级的数据溯源系统——经数据处理管线传播作者身份,并经确定性查询把撤销请求解析为精确遗忘集。在219,555个维基百科页面上的评估显示:记录级溯源消除数据集级过度删除(从101倍降到1.3倍),而集成的吞吐开销在wiki数据上为HuggingFace的1.3–4.0%与Datatrove的2.1–19.0%。在1.7B模型上:基于溯源的遗忘集相对同规模随机基线在全部受评作者上一致降低机器遗忘的附带损害(保留困惑度),成员推断测试表明它们选中了真正被记住的内容。