论文
Diffusion-CAM:面向dMLLM的忠实视觉解释
Diffusion-CAM: Faithful Visual Explanations for dMLLMs
摘要
尽管扩散多模态大语言模型(dMLLM)近来在多模态生成上取得显著进展,可解释性机制的发展仍落后于其架构演进。与产生顺序激活的传统自回归模型不同,基于扩散的架构通过并行去噪生成token,在整个序列上形成平滑、分布式的激活模式。因此,为局部顺序依赖量身定制的现有类激活映射(CAM)方法并不适合解释这些非自回归行为。为弥合这一空缺,我们提出Diffusion-CAM,首个专为dMLLM定制的可解释性方法。我们以可微方式探查transformer骨干中的中间表示,导出原始激活图,从而同时捕获潜在特征及其类别特定梯度。为应对这些原始信号的固有随机性,我们引入四个关键模块,以消解空间歧义并缓解图像内混淆因素与冗余token相关性。大量实验表明,Diffusion-CAM在定位精度与视觉保真度上均显著超越SoTA方法,为理解扩散多模态系统的并行生成过程确立了新标准。
