论文

视觉语言模型中的稀疏视觉思维电路

Sparse Visual Thought Circuits in Vision-Language Models

模型评测模型行为与机制分析

摘要

稀疏自编码器(SAE)提升了多模态模型的可解释性,但SAE特征是否构成模块化、可组合的推理单元——这是许多基于干预的引导方法的前提假设——仍不清楚。我们检验了这一模块化假设,发现它常常不成立:对一个任务选择性特征集进行干预可以适度提升推理准确率,而对两个此类特征集的并集进行干预则会可靠地引发输出漂移(预测的大幅非预期变化)并降低准确率,即使在范数匹配的扰动下也是如此。这种非模块化的电路干扰与共享内部通路的情形一致,在共享通路中特征并集会放大激活偏移。我们开发了一个可复现的因果分析流水线,用于在Qwen3-VL-8B中定位并检验这些稀疏视觉思维电路。在一个包含七种任务类型和三个难度级别的受控合成基准上,线性探针识别出任务类型信息位于解码器中层的一个位置。我们在该层训练SAE,通过显式规则构建任务选择性特征集,并在量化准确率和漂移的同时执行推理时缩放与消融。我们的发现经过自举子样本和置换对照验证,并在多个VLM家族和五个不同数据集上得到复现,厘清了SAE特征可组合性的边界,并为更可靠的VLM控制提供了严格的诊断框架。

视觉语言模型中的稀疏视觉思维电路:论文配图
图 1:冻结视觉语言模型中的稀疏视觉思维回路 (SVTC)。我们(1)通过探测跨层组的池化隐藏状态的任务类型(7 路)和难度(3 路)来定位与推理相关的信号,选择预测站点(例如,解码器 Mmiddle_2M_{\text{middle\_2}}); (2) 在该站点训练一个稀疏自动编码器,将激活 hεℝ4096h\in\mathbb{R}^{4096} 映射到稀疏代码 zεℝ32768z\in\mathbb{R}^{32768} 并通过基于规则的选择性构建任务选择性特征集(模式、全局及其并集); (3) 通过修改所选的 zz 坐标(缩放/消融)、解码重建并应用所得更新以获得 h′h^{\prime} 来执行推理时间干预。我们报告精度变化 Δ​Acc\Delta\mathrm{Acc} (pp)、输出漂移变化 (%) 和扰动幅度 𝔼⁡[∥Δ∥/∥h∥]\mathbb{E}[\lVert\Delta\rVert/\lVert h\rVert],使用负控制(随机和排列集)、对子采样种子进行引导,以及对 val/test 进行验证。