论文
增强基础VLM对缺失模态的鲁棒性:可扩展扩散实现双向特征恢复
Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration
摘要
视觉语言模型 (VLM) 通常在推理过程中假设完整的模态输入。然而,当某些方式不可用或不完整时,它们的有效性会急剧下降。当前的研究主要面临两个困境:基于提示的方法很难恢复缺失但不可或缺的特征,并损害 VLM 的泛化能力。基于插补的方法缺乏有效的指导,很容易产生语义上不相关的噪音。在维持 VLM 泛化的同时恢复精确语义仍然具有挑战性。因此,我们在本文中提出了一种通用的缺失模态恢复策略。我们引入增强的扩散模型作为可插入的中期训练模块,以有效地恢复丢失的特征。我们的策略引入了两项关键创新:(I)动态模态门控,它自适应地利用条件特征来引导语义一致特征的生成; (二)跨模态相互学习机制,桥接双编码器的语义空间,实现双向对齐。跨基准数据集的零样本评估表明我们的方法优于现有的基线方法。大量的实验和消融研究证实我们的模型是缺失模态场景中 VLM 的稳健且可扩展的扩展,确保了不同缺失率和环境下的可靠性。我们的代码和模型将公开。
