论文

数据影响归因:先明确反事实规格再比较估计器

Which Influence Are We Estimating? The Role of Counterfactual Specifications in Data Attribution

模型评测模型行为与机制分析

摘要

估计训练样例对模型行为的影响对于数据调试、评估和归因至关重要。现有的影响力估计器经常产生不兼容的排名,这通常归因于近似误差。我们认为,分歧的一个更根本的根源是规范不匹配:影响取决于所归因的行为、应用于每个训练示例的干预以及将干预映射到模型响应的反事实训练过程。当目标行为需要易于处理的替代项(例如查询损失、logit 或裕度)时,这些选择尤其重要。我们将影响形式化为反事实估计值,将估计值之间的规范不匹配与估计固定估计值时的近似误差区分开来,并通过其隐含的规范来组织代表性估计器。我们进一步推导出局部分解,揭示行为信号、训练信号和反事实参数响应如何相互作用。对照实验表明,不同规格下的精确估计量可能会导致不同的排名,而随着扰动远离其线性化点,近似误差会增加。噪声标签检测和大语言模型归因的实验表明,规范选择显着影响归因质量,尤其是行为替代的选择。行为一致的规范可以识别被默认的基于损失或基于相似性的规范所掩盖的特定目标的训练示例。这些结果将规范分析确立为解释和比较数据影响估计量的必要的第一步。

数据影响排序会随行为代理目标和反事实训练过程的选择而变化。
图1(图注摘要):数据影响排序会随行为代理目标和反事实训练过程的选择而变化。