论文

使用联合稀疏自动编码器引导视觉语言模型

Steering Vision-Language Models with Joint Sparse Autoencoders

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 在分析语言模型方面表现出了良好的前景,但将其应用于视觉语言模型 (VLM) 通常会产生难以用作可控跨模态转向方向的表示。我们引入了联合稀疏自动编码器(JSAE),它使用显式对齐约束将序列池视觉和语言激活联合分解为共享的、可解释的图像/描述级特征。 JSAE 应用于 LLaVA,恢复可识别概念(例如食物和动物)的跨模态特征。通过双向干预(附加转向和抑制),我们在协议下观察到层相关的不对称性:附加转向在中后期(输出前)层达到峰值并在两端减弱,而抑制分数在统计噪声内的所有探测层中保持在可比较的范围内。对三种 VLM(即 LLaVA-v1.6-Mistral-7B、Llama3-LLaVA-8B 和基于 MoE 的 Qwen3-VL-30B)的实验显示了跨架构的相关层局部化效果。总之,这些结果表明,与此处测试的无约束替代方案相比,在可识别的层范围内,显式对齐的稀疏表示支持对多模态特征进行更可控的基于干预的分析。