论文

相同答案,不同表征:VLM中隐藏的不稳定性

Same Answer, Different Representations: Hidden instability in VLMs

模型评测评测方法与指标

摘要

视觉语言模型(VLM)的鲁棒性通常通过输出层面的不变性来评估,这隐含地假设稳定的预测反映了稳定的多模态处理。在本工作中,我们论证这一假设并不充分。我们提出一个表征感知且频率感知的评估框架,在标准标签指标之外,还测量内部嵌入漂移、谱敏感性以及结构平滑度(视觉 token 的空间一致性)。将该框架应用于现代 VLM 在 SEEDBench、MMMU 与 POPE 数据集上的表现,揭示了三种不同的失效模式。第一,模型经常在保持预测答案的同时发生大幅内部表征漂移;对于文本叠加等扰动,这种漂移接近图像间差异的量级,表明尽管输出未变,表征却移动到通常被无关输入占据的区域。第二,鲁棒性并不随规模提升;更大的模型取得更高准确率,却表现出相同甚至更大的敏感性,这与更尖锐却更脆弱的决策边界相符。第三,我们发现扰动对不同任务的影响不同:当扰动破坏模型组合粗粒度与细粒度视觉线索的方式时会损害推理,而在幻觉基准上,扰动可通过促使模型生成更保守的答案来减少假阳性。

相同答案,不同表征:VLM中隐藏的不稳定性
图1:在 Translation 与 Textoverlay 扰动下,ans_mcq_free 嵌入的 Drift 与对照漂移(control drift)的余弦距离(1−cos)。蓝色表示相对基准图像的扰动诱发漂移;橙色表示对照漂移(基准图像与随机采样的其他图像对比)。左:Translation。右:Textoverlay。与几何扰动不同,Textoverlay 扰动诱发的分布不再与对照漂移保持良好分离,这表明该表示在嵌入空间中不再保持局部性。