论文

测试时 logits 提示无源缺失模态适应

Test-Time Logit Prompting for Source-Free Missing Modality Adaptation

模型训练参数高效训练

摘要

视觉语言模型(VLM)通过利用大规模图像文本对的互补信息取得了显着的性能。然而,在实际部署过程中,经常会遇到模态输入缺失的情况,这通常会导致性能显着下降。现有方法主要通过从源训练数据中学习模态补偿策略来增强模型的鲁棒性。然而,它们对源训练数据的依赖使得当由于隐私、存储或可访问性限制而无法获得原始数据时,它们很难应用,例如临床应用和个性化人工智能服务。这就提出了一个重要但尚未充分探索的问题:VLM 是否可以在测试时有效地适应缺少模式的视觉识别,而无需访问源训练数据?为此,我们提出了 Test-Time logits Prompting (TLP),这是一种轻量级的无源测试时适应框架,用于缺少模态的视觉识别。为了解决缺失引起的预测变化,TLP 通过不确定性感知调整和模态完全一致性正则化来优化 logits 提示,自适应调整预测置信度,同时保持语义一致性。跨不同视觉语言基准的大量实验表明,TLP 能够持续增强模态缺失场景下的识别性能,实现高达 8% 的改进,同时只需要数百个可调参数和一些测试时优化步骤。