论文

Concept Influence:利用可解释性提升训练数据归属的性能与效率

Concept Influence: Leveraging Interpretability to Improve Performance and Efficiency in Training Data Attribution

模型评测评测方法与指标

摘要

随着大语言模型不断被训练和微调,从业者需要能识别哪些训练数据驱动特定行为(尤其是非预期行为)的方法。训练数据归属(TDA)方法通过估计数据点影响来解决这一问题。影响函数等现有方法既计算昂贵,又基于单个测试样本做归属,这可能使结果偏向句法而非语义相似性。为解决可扩展性与对抽象行为的影响力问题,我们在归属过程中利用模型内部可解释的结构。首先,我们提出 Concept Influence,将模型行为归因于语义方向(如线性探针或稀疏自编码器特征)而非单个测试样本。其次,我们证明简单的基于探针的归属方法是 Concept Influence 的一阶近似,性能相当且快一个数量级以上。我们在涌现失准基准和真实训练后数据集上实证验证 Concept Influence 及其近似,证明其性能与经典影响函数相当,同时可扩展性显著更强。更广泛地,我们表明在传统 TDA 流水线中纳入可解释结构,可以实现更可扩展、更可解释、经由数据对模型行为更好的控制。

Concept Influence:利用可解释性提升训练数据归属的性能与效率
图2:过滤掉引发涌现性错位(EM)的数据集并重新训练。我们在四个EM数据集(Misaligned Opinions、Bad Medical Advice、Insecure Code和GSM8k Mistakes)上微调Qwen2.5-7B,并使用LLM裁判评估其前后的“邪恶度”(evilness)。随后我们使用四种不同的数据归因方法,尝试移除(Remove Most)或增加(Remove Least)模型的邪恶度。在所有数据集上,Concept Influence表现最佳,而高效近似在许多设置下取得与影响函数相当的性能。