论文

良好的初始化足以实现忠实的视觉归因

A Good Initialization is All You Need for Faithful Visual Attribution

模型评测模型行为与机制分析

摘要

忠实的视觉归因可识别哪些图像区域支持模型预测。基于搜索的扰动方法通过屏蔽区域和测量分数变化来引导插入-删除忠实性前沿,但它们通常输出所有区域的完整排序。许多应用程序,尤其是 MLLM 归因和修复,只需要一个紧凑的 top-\(k\) 证据掩码。我们研究这个面具优先的归因问题。精确的 \(k\) 区域掩模是组合的:有用的证据可能取决于精细区域之间的相互作用。粗略分组可以稳定早期搜索,但会聚合冗余内容,而一步评分可能会错过高价值组合。我们引入两种仅向前的方法。 \textsc{CoPAIR} 使用 PhaseWin——贪婪间隙诊断来构造粗略的单例/对候选者,以热启动全排序搜索。 \textsc{TRACE} 通过交叉熵采样、精英保留和分布更新以及有限预算恢复分析直接搜索固定基数精细区域掩模。生成的证据集可以作为紧凑的归因掩码返回,或者在需要完整排名时用于初始化 Greedy 或 PhaseWin。在使用 CLIP ViT-L/14、CLIP RN101 和 ResNet-101 的 ImageNet 分类中,我们的初始化搜索方法为包容性前向呼叫会计下的忠实全排序归因建立了一个新的最先进前沿。在使用 Qwen2.5-VL-3B-Instruct 和 LLaVA-v1.5-7B 的 POPE 和 RePOPE 上,\textsc{TRACE}+Greedy 给出了最强的基于搜索的 MLLM 归因结果。直接\textsc{TRACE}掩码进一步实现了\(94.44\%\)和\(96.00\%\)的单点RePOPE修复率,表明紧凑的证据掩码可以是可操作的归因输出,而不仅仅是完整排名的前缀。