论文
透过电路看视觉:面向视觉Transformer的忠实机制可解释性
Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers
摘要
神经网络内部推理的透明性是可解释性研究的核心,有助于增进对这些模型的信任、安全保障与理解。机制可解释性领域近来聚焦于研究任务特定的计算图,即由模型组件之间的连接(边)定义的图。此类基于边的电路已在大语言模型语境下得到定义,但视觉方向的方法迄今只考虑基于神经元的电路。后者只能说明编码了哪些信息,却无法说明信息如何经由神经网络的复杂布线进行路由。在本工作中,我们研究能否通过计算图在视觉Transformer中识别出有用的机制电路。我们提出一种有效的自动视觉电路发现方法(Automatic Visual Circuit Discovery, Vi-CD),它能恢复分类任务的类别特定电路、识别CLIP中排版攻击背后的电路,并发现可用于引导以纠正模型有害行为的电路。总体而言,我们发现可以从视觉Transformer中恢复富有洞见且可操作的基于边的电路,为这些模型的内部计算增添了透明性。
