论文
特定模态转变下视觉语言模型的专业化引导测试时间适应
Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift
摘要
视觉-语言模型在部署时可能会面临不对称的视觉和文本变化。这些转变暴露了多模态故障模式,其中不可靠的分支仍然过度自信,主导融合,并导致基于熵的测试时间适应,以加剧不正确的预测。我们将这种行为建模为双随机后验混合,并将演员适应建模为约束去混合。大规模引导多模态测试时间适应 (MG-MTTA) 冻结两个编码器并仅更新轻量级融合模块。运行锚一致性估计相对分支漂移,而跨模态冲突在熵锐化之前调节模态主导地位。该分析为熵减少提供了充分的条件,以保持干净的决策,并提供了一个明确的阈值,在该阈值下,有偏模态会反转融合排序。在视觉、文本和联合移位中,MG-MTTA 将文本移位下的 ImageNet top-1 准确率从 57.97\% 提高到 66.51\%,将联合移位下的 ImageNet top-1 准确率从 21.68\% 提高到 26.27\%,同时减少错误更自信的失败。最大的收益发生在文本和联合转换下,其中两个分支在可靠性方面差异更大。项目页面:https://mg-mtta.github.io/。