论文

视觉语言模型中模态顺序一致性的测试时训练

Test-Time Training for Modality Order Consistency in Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

我们发现视觉语言模型对特定的语义上不相关的变化很敏感:图像和问题的呈现顺序。在三个模型和三个基准中,图像优先提示始终优于问题优先提示,揭示了可重复的模态顺序失败。我们利用这个差距来设计一种顺序一致的测试时间训练方法。我们的方法基本上缩小了所有评估设置中的模态顺序差距。令人惊讶的是,它还在基线上更强的图像优先分支中产生了一致的改进,从而引导两个顺序朝着相互一致性的方向发展。激活补丁将排序失败定位到狭窄的中间网络区域,该区域的提示订单之间的表示存在很大差异。我们发现测试时训练方法可以修复这种跨层的错位。总之,我们的结果将模态顺序敏感性确定为 VLM 中的电路级故障,并证明简单的、不对称的测试时间调整可以有效地缓解它,甚至可以提高基准性能。