论文
相同答案,不同表征:VLM中隐藏的不稳定性
Same Answer, Different Representations: Hidden instability in VLMs
摘要
视觉语言模型(VLM)的鲁棒性通常通过输出层面的不变性来评估,这隐含地假设稳定的预测反映了稳定的多模态处理。在本工作中,我们论证这一假设并不充分。我们提出一个表征感知且频率感知的评估框架,在标准标签指标之外,还测量内部嵌入漂移、谱敏感性以及结构平滑度(视觉 token 的空间一致性)。将该框架应用于现代 VLM 在 SEEDBench、MMMU 与 POPE 数据集上的表现,揭示了三种不同的失效模式。第一,模型经常在保持预测答案的同时发生大幅内部表征漂移;对于文本叠加等扰动,这种漂移接近图像间差异的量级,表明尽管输出未变,表征却移动到通常被无关输入占据的区域。第二,鲁棒性并不随规模提升;更大的模型取得更高准确率,却表现出相同甚至更大的敏感性,这与更尖锐却更脆弱的决策边界相符。第三,我们发现扰动对不同任务的影响不同:当扰动破坏模型组合粗粒度与细粒度视觉线索的方式时会损害推理,而在幻觉基准上,扰动可通过促使模型生成更保守的答案来减少假阳性。
