论文

视觉机制可解释性的分布视图:KL-最小软约束原理

A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle

模型评测模型行为与机制分析

摘要

目前视觉机械可解释性 (MI) 的大多数范式仍然局限于通过启发式方法解释视觉模型的内部单元(例如,top-$K$ 激活检索或正则化优化)。在这项工作中,我们建立了视觉 MI 的理论分布视图,它模拟了特征激活对自然图像分布的影响,从而制定了 Kullback-Leibler (KL) 最小优化问题来建模 MI 任务。在此框架下,在以前的 MI 范式中发现了统计偏差,这表明它们可能在人类感知上无法解释(即偏离自然图像分布),或者在机械上不忠实于视觉模型(即无法激活模型特征)。为了解决分布视图下的偏差,我们提出了一种具有 KL 最小软约束原理的视觉 MI 模型,理论上平衡了可解释性和 忠实性。我们通过能量引导扩散后验采样实现了这一原理。大量的实验验证了所提出的分布视图的理论可靠性,并证明了我们的范式在 DINOv3 视觉模型上的实际有效性。