论文

从可靠的潜在提示中学习缺失模态的视觉识别

Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

模型训练参数高效训练

摘要

大规模多模态模型(LMM)通过协同不同、大规模配对模态的信息,在视觉识别方面取得了卓越的性能。然而,在现实场景中,缺失模态输入普遍存在,导致针对模态完整数据优化的模型表现出性能急剧下降。现有的研究引入了提示学习来缓解这个问题,通常是通过从实例级特征生成动态提示,无论输入模式是否完整或部分缺失。然而,这种输入条件策略受到实例级特征不断升级的不可靠性的阻碍;由于较高的缺失率会增加不完整模式的比例,因此即时学习的不稳定性会限制模型的性能。为了解决这个限制,我们假设可学习的潜在提示本身封装了稳定的、模态固有的先验,这些先验与损坏的输入分离。因此,我们提出了一种新颖的范式:从可靠的潜在提示中学习。与之前的方法不同,我们将与输入无关的可学习提示建模为稳定的潜在锚点,即使在极端缺失率(例如 90%)下,也能实现稳健的指导和有效的跨模式知识补偿。三个基准数据集的实证结果表明,我们的“从潜在提示中学习”方法在各种缺失模态场景中实现了最先进的性能。大量的实验进一步证实了该范式在为缺失模态问题提供稳健解决方案方面的有效性。