论文

视觉语言模型中基于方向的推理时防御的跨架构审计

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

模型评测安全与风险评测

摘要

针对视觉语言模型越狱攻击的推理时防御,通常在选定的解码器层从残差流中减去一个经校准的方向。我们在量级受控协议下,比较来自四个架构家族、15个模型与层单元格的五种防御候选方法,该协议为每个提示匹配干预大小,并将每个方向与相同范数的随机对照配对。候选方法为:平均图像条件化偏移、CMRM风格的拒绝方向、ShiftDC风格的攻击特定残差、提示模型忽略图像的指令,以及随机对照。没有任何候选方法能在拒绝恢复与效用保持两方面同时占优。图像条件化偏移在LLaVA 1.5和Pixtral 12B上领先,并且是唯一在所有家族中效用损失都保持在测量噪声底线的候选方法。提示指令在Qwen2.5 VL上领先,而攻击特定残差在Qwen2 VL 2B上领先。图像条件化方向在15个单元格中的13个里是方向特定的,但强烈依赖架构,且在唯一一对维度兼容的组合LLaVA 1.5 13B与Pixtral 12B之间不可迁移。我们还将纯文本与多模态的拒绝几何联系起来。CMRM方向与图像条件化偏移在全部15个单元格中具有正的余弦对齐,均值0.35,范围0.17到0.65,是随机向量零假设的15到25倍,符号检验p值约为3e-5。这些结果表明,两种配方恢复了部分重叠的几何结构,且基于方向的防御应针对每个语言解码器家族分别校准。