论文
用于特征发现和控制的多模态模型差异
Multimodal Model Diffing for Feature Discovery and Control
摘要
多模态 大语言模型 (MLLM) 表现出很强的视觉理解能力,但导致这些行为的内部特征仍然难以识别、审核或控制。虽然适用于事后检查,但使用稀疏自动编码器 (SAE) 分解为可解释的特征方向的隐藏状态既不能轻易隔离哪些特征被多模态训练改变,也不能直接用于目标控制。我们引入了 MMDiff,这是一个多模态模型差异框架,用于训练多模态 SAE 并将其转换为特征级接口,用于发现和控制多模态行为。 MMDiff 支持三种用途:(i) 特征隔离,通过将基础 LM SAE 与其多模态适应的对应物进行比较,以识别多模态训练改变的特征; (ii) 特定于任务的特征检测,通过每个标记的对比激发分析来隔离因果特征; (iii) 特征级控制,通过因果关系删除或引导发现的特征方向。我们为三个 MLLM 系列(LLaVA-MORE、PaliGemma 2 和 InternVL3.5)训练多模态 SAE,并评估视觉空间理解、多模态安全性和 OCR。 MMDiff 发现了稀疏的、因果特定的特征,选择性地删除这些特征会导致目标行为在空间任务上平均降低 12%,在 OCR 上平均降低 17%,并使多模式安全攻击的攻击成功率降低 24%,而对 VQA 性能没有影响。与标准单层转向基线相比,转向这些功能可将空间和 OCR 准确度平均提高 +3.6% 和 +1.8%。这些结果表明,多模式 SAE 不仅可以作为可解释性工具,还可以作为审核、指导和控制 MLLM 行为的机制,以实现更安全、更有能力的一代。