论文
LINE:基于 LLM 的视觉模型迭代神经元解释
LINE: LLM-based Iterative Neuron Explanations for Vision Models
摘要
解释深度神经网络中的单个神经元是理解其复杂决策过程和确保人工智能安全的关键一步。尽管最近在神经元标记方面取得了进展,但现有方法通常将搜索空间限制为预定义的概念词汇,或者产生过于具体的描述,而无法捕获更高阶的全局概念。我们推出了 LINE,一种新颖的 无需训练 迭代方法,专为视觉模型中的开放词汇概念标记而定制。 LINE 在严格的黑盒设置中运行,利用 大语言模型 和文本到图像生成器,在激活历史记录的指导下,在闭环中迭代地提出和完善概念。 LINE 在多个模型架构上实现了最先进的性能,在 ImageNet 上实现了高达 0.11 的 AUC 改进,在 Places365 上实现了 0.05 的 AUC 改进,同时平均发现了 27% 被预定义词汇表遗漏的新概念。除了识别顶级概念之外,LINE 还提供完整的生成历史记录,从而实现多语义评估并生成与梯度相关激活最大化方法相媲美的视觉解释。源代码将很快提供。