论文

ACML:动态对齐与校准多模态表示的置信度差异

Dynamic Alignment and Calibration for Multimodal Learning

模型架构混合架构

摘要

动态多模态学习旨在通过自适应地建模跨模态的信息差异来学习鲁棒的表示。然而,现有方法仍然存在两个局限性:(i)静态跨模态对齐策略通常对所有样本施加统一的约束,同时忽略样本间的变化,可能导致不合理的过度对齐; (ii) 置信度或不确定性感知融合方法通常无法充分考虑跨模态的特征量级和置信度差异。对于具有显着特征量级差异或较小置信度差距的模态对,根据置信度严格对齐融合权重可能不可靠。为了解决这些问题,我们提出了一个对齐和校准驱动的多模态学习框架(ACML)。具体来说,ACML 结合了动态跨模态三元组对齐模块,该模块为高置信度正对强制执行强大的语义一致性,同时鼓励根据置信度差距在高置信度和低置信度正对之间进行不同的表示学习。此外,ACML 引入了一种差异感知注意力校准策略,该策略根据特征大小和跨模态的置信度差异自适应调整注意力正则化,从而减轻由不合理的融合约束引起的偏差。对多个多模式基准数据集的大量实验表明,ACML 始终比最新的最先进方法实现卓越的性能和鲁棒性。

ACML:动态对齐与校准多模态表示的置信度差异:论文原图
图 1:提议的 ACML 框架概述。在$\mathcal{L}_{\text{DCTA}}$、$\triangle$和$\square$中表示不同的类别,颜色代表模态,颜色强度反映置信度。