论文

增强基础VLM对缺失模态的鲁棒性:可扩展扩散实现双向特征恢复

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

模型训练预训练

摘要

视觉语言模型 (VLM) 通常在推理过程中假设完整的模态输入。然而,当某些方式不可用或不完整时,它们的有效性会急剧下降。当前的研究主要面临两个困境:基于提示的方法很难恢复缺失但不可或缺的特征,并损害 VLM 的泛化能力。基于插补的方法缺乏有效的指导,很容易产生语义上不相关的噪音。在维持 VLM 泛化的同时恢复精确语义仍然具有挑战性。因此,我们在本文中提出了一种通用的缺失模态恢复策略。我们引入增强的扩散模型作为可插入的中期训练模块,以有效地恢复丢失的特征。我们的策略引入了两项关键创新:(I)动态模态门控,它自适应地利用条件特征来引导语义一致特征的生成; (二)跨模态相互学习机制,桥接双编码器的语义空间,实现双向对齐。跨基准数据集的零样本评估表明我们的方法优于现有的基线方法。大量的实验和消融研究证实我们的模型是缺失模态场景中 VLM 的稳健且可扩展的扩展,确保了不同缺失率和环境下的可靠性。我们的代码和模型将公开。

增强基础VLM对缺失模态的鲁棒性:可扩展扩散实现双向特征恢复
图3:我们的缺失模态恢复(Missing Modality Restoration)框架的架构。 利用冻结的预训练 VLM 编码器对可用模态进行特征提取的过程。 上部描绘 DiT 主干的门控机制,下部给出扩散模型如何重塑特征分布的概念性说明。 相互学习机制的架构设计,在特定去噪区间内融入多目标损失函数。