论文

提取扩散分数差异以实现有效的训练数据归因

Distilling Diffusion Score Discrepancy for Efficient Training Data Attribution

模型评测模型行为与机制分析

摘要

扩散模型的训练数据归因旨在识别影响生成实例的训练样本,但现有方法要么需要昂贵的每个样本梯度计算,要么需要特定于查询的模型优化。此外,大多数方法归因于代理损失的变化,而不是实际模型生成行为的变化。我们通过直接使用局部分数差异度量来制定归因来解决这些限制,该度量适用于任何扩散变体(包括 DDPM、EDM 和流匹配),并表明无需重新训练即可估计此类度量,作为预处理的梯度相似性。我们将该估计器实例化为通过分数差异训练数据影响 (TID),它使用克罗内克因子曲率来避免随机投影和每个样本梯度存储。然后,我们将 TID 提炼成 TIDE,这是一种仅前向的学生,经过在线训练,可以根据扩散模型的内部激活重现教师的排名。在 CIFAR-10、ArtBench-10 和 MS-COCO 的反事实评估下,TID 匹配或优于最先进的方法,而 TIDE 保留了 TID 的大部分准确性,每次查询成本降低了四到五个数量级,以毫秒为单位对生成的样本进行归因,并且比生成本身更快。