论文
扰动响应中证据、矛盾与脆弱性的分解
Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses
摘要
扰动方法通过度量输入改变下的预测变化来解释模型决策,但响应大小只能告诉我们模型反应有多大,而不能说明该反应意味着什么。同样的大小可以支持最终的事实-反事实差异、与之相反,或者沿扰动路径强烈出现却在端点处消失。因此,我们追踪成对输入被逐步揭示时对比的发展过程,并用最终对比来解读该轨迹。我们提出 DECAF(证据、矛盾与脆弱性分解),将一致、相反和端点归零的响应分派为证据 E、矛盾 C 与脆弱性 F。该分解精确保留普通幅度,即 Abs = E + C + F,并在端点相对公理下是唯一的。在受控的视觉与表格设置中,三个成分都能追踪独立测得的行为。在 72 个模型的 ImageNet-9 审计中,我们比较了响应幅度几乎相同但独立测得行为不同的案例。最大 DECAF 成分在 96.4% 的案例中与观察到的行为一致,而仅凭幅度时为 35.0%。仅改变揭示路径就使总响应增加近 80%,但证据几乎不变,脆弱性却增长超过 4 倍。在 FunnyBirds 和 ImageNet-1k 上,仅需前向传播的短 DECAF 轨迹优于所测的通用归因基线。在 1B 规模的 DINOv2 模型上,一条短轨迹以 4.75 倍更低的墙钟时间和 2.36 倍更低的峰值显存匹配了强梯度基线。