压缩版视觉语言模型(VLM)被广泛用于降低内存和计算成本,因而成为现实部署的合适选择。然而,压缩这类模型引发了内部计算与安全行为能否保持的担忧。在本工作中,我们利用因果电路分析和基于crosscoder的特征比较,考察剪枝和量化如何在根本层面改变代表性VLM的内部机制。我们观察到,剪枝通常保持电路结构完整,但会使内部特征发生旋转和衰减;量化则在更高层面修改电路,却使幸存特征保持更好的对齐。借助这一洞见,我们还提出VLMSafe-420,一个将有害输入与各类安全主题下匹配的良性反事实样本配对的新型基准。我们的发现表明,剪枝会导致真实拒绝行为的急剧下降,提示压缩方式的选择具有安全影响。
(a) BLIP-VQA(隐藏维度 = 768)。对于 EF=4,SAE 特征的数量为 3072;对于 EF=8,SAE 特征的数量为 6144。考虑到 6% 的强制共享特征,这些总数分别为 184184 和 325325。然而,Wanda 或 INT4 压缩中共享对齐特征的数量要少得多。(b) LLaVAv1.5-7B(隐藏维度 = 1024)。对于 EF=4,SAE 特征的数量为 4096 个;对于 EF=8,SAE 特征的数量为 8192 个。考虑到 6% 的强制共享特征,这些总数分别为 245245 和 491491。在任何一种情况下,Wanda 的剩余共享对齐特征都要高得多。图 2:BLIP-VQA 和 LLaVA 在 Visual-Counterfact 上的 Crosscoder 类分布,使用 TopK=200\text{TopK}=200。根据 ρi\rho_{i} (解码器范数比)和 θi\theta_{i} (余弦相似度),特征被分类为仅未压缩、共享对齐、中间、重定向、衰减或仅压缩。该分布定量地证实了每种压缩方法保留、修改或替换原始特征结构的程度。