论文
Corrupted but Correct:VLM为何在内部对自己说谎
Corrupted but Correct: Why Vision-Language Models Lie to Themselves Internally
摘要
定向对抗扰动可以把VLM对固定目标标题的教师强制训练损失压到近零,但同一模型自由生成时却产出原始正确描述而无目标痕迹。我们称这种分离为训练/推理差距,并在Qwen2.5-VL-7B-Instruct上以200张留出COCO图像的受控两阶段PGD攻击给出精确机制解释。首先,图像级像素统计(包括从CNN鲁棒性文献正确重实现的基于纹理的可攻击性度量)对哪些图像被腐坏基本无预测力(最佳预测器r=-0.050,p=0.484;岭回归R²=0.069)。其次,用logit lens把差距定位到单个自回归步:在正确首token已生成的条件下,目标token的秩对每张图与每种条件都固定在152064词表条目中的恰好第3488位,方差为零。第三,追踪全部28个LLM解码层的目标token秩发现:视觉编码器以相当的幅度腐坏每张图的表示(无论最终结局),但语言模型解码器随后差异化仲裁——对易感图像放大腐坏信号,对抵抗图像主动将其抑制到低于干净基线(p<0.001,秩双列r=0.579)。merger隐状态上的线性探针以AUC=0.858区分两种结局(我们标记该估计的循环性顾虑)。合起来,结果论证自回归VLM的对抗鲁棒性实质上是语言解码器先验的属性而非视觉编码器——对部署VLM系统的忠实性评估与防御应针对何处有直接含义。