论文

视觉语言模型中的跨模态注意力分析与优化:视觉可靠性研究

Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

模型评测鲁棒性、公平性与可信度评测

摘要

视觉语言模型(VLM)实现了强大的跨模态性能,但最近的证据表明它们过度依赖文本描述,而没有充分利用视觉证据——这种现象被称为“文本快捷学习”。我们提出了一种对抗性评估框架,通过测量语义冲突的文本与未更改的图像配对时的准确性下降(下降)来量化这种跨模态依赖性。四种对抗策略——形状\_交换、颜色\_交换、位置\_交换和随机\_文本——应用于受控几何形状数据集($n{=}1{,}000$)。我们比较了三种配置:基线 CLIP (ViT-B/32)、LoRA 微调 和 LoRA Optimized(集成硬负挖掘、标签平滑、分层学习率、余弦重启、课程学习和数据增强)。优化后的模型将平均 Drop 从 27.5\% 降低到 9.8\%(64.4\% 相对改进,$p{<}0.001$),同时保持 97\% 的正常准确度。注意力可视化和嵌入空间分析证实,优化后的模型更多地关注视觉特征并实现更紧密的跨模式对齐。