论文

对比语义投射:用对比示例进行忠实的神经元标记

Contrastive Semantic Projection: Faithful Neuron Labeling with Contrastive Examples

模型评测模型行为与机制分析

摘要

神经元标记将文本描述分配给深度网络的内部单元。现有的方法通常依赖于高度活跃的示例,通常通过关注主导但偶然的视觉因素来产生广泛或误导性的标签。 FALCON 等之前的工作引入了对比示例(在语义上与激活示例相似但引发低激活的输入)来强化解释,但它主要解决子空间级别的可解释性,而不是可扩展的神经元级别标记。我们分两个阶段重新审视神经元级标记的对比解释:(1) 使用视觉语言模型 (VLM) 生成候选标签,(2) 使用类 CLIP 编码器分配标签。首先,我们证明向 VLM 提供对比图像集会产生更具体、更忠实的候选标签。其次,我们介绍对比语义投影(CSP),它是 SemanticLens 的扩展,它将对比示例直接纳入其基于 CLIP 的评分和选择流程中。通过关于黑色素瘤检测的大量实验和案例研究,对比标记在最先进的基线上提高了 忠实性 和语义粒度。我们的结果表明,对比示例是神经元标记和分析流程中简单而强大且目前未得到充分利用的组成部分。