论文
视觉语言模型中的稀疏视觉思维电路
Sparse Visual Thought Circuits in Vision-Language Models
摘要
稀疏自编码器(SAE)提升了多模态模型的可解释性,但SAE特征是否构成模块化、可组合的推理单元——这是许多基于干预的引导方法的前提假设——仍不清楚。我们检验了这一模块化假设,发现它常常不成立:对一个任务选择性特征集进行干预可以适度提升推理准确率,而对两个此类特征集的并集进行干预则会可靠地引发输出漂移(预测的大幅非预期变化)并降低准确率,即使在范数匹配的扰动下也是如此。这种非模块化的电路干扰与共享内部通路的情形一致,在共享通路中特征并集会放大激活偏移。我们开发了一个可复现的因果分析流水线,用于在Qwen3-VL-8B中定位并检验这些稀疏视觉思维电路。在一个包含七种任务类型和三个难度级别的受控合成基准上,线性探针识别出任务类型信息位于解码器中层的一个位置。我们在该层训练SAE,通过显式规则构建任务选择性特征集,并在量化准确率和漂移的同时执行推理时缩放与消融。我们的发现经过自举子样本和置换对照验证,并在多个VLM家族和五个不同数据集上得到复现,厘清了SAE特征可组合性的边界,并为更可靠的VLM控制提供了严格的诊断框架。
