论文
事半功倍:通过条件和降级掩模自动编码器处理异构多模态图像联合预训练
Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder
摘要
在极其异构的模态中学习鲁棒的表示仍然是多模态视觉中的一个基本挑战。作为这一挑战的一个关键而深刻的实例,高分辨率(HR)联合光学和合成孔径雷达(SAR)预训练寻求模态协同以相互增强单源表示;它的潜力受到异质性分辨率悖论的严重阻碍:更精细的空间尺度极大地放大了复杂雷达几何形状和非同源光学纹理之间的物理差异。因此,将面向中等分辨率的刚性对齐范式迁移到 HR 场景会触发严重的特征抑制以强制等效,或者触发由极端认知不确定性驱动的特征污染。这两个极端都不可避免地会导致深刻的代表性退化和负迁移。为了克服这个瓶颈,我们提出了 CoDe-MAE,开创了 \textit{更好的协同作用,更少的对齐}哲学。首先,光锚定 知识蒸馏 (OKD) 通过将 SAR 的散斑噪声映射到纯语义流形来隐式正则化它。在此基础上,条件对比学习(CCL)利用梯度缓冲机制来协调共享共识,同时安全地保留不同的物理特征。同时,跨模态降级重建(CDR)故意去除非同源光谱伪特征,截断固有的不适定映射以捕获真正的结构不变量。广泛的分析验证了我们的理论主张。 CoDe-MAE 在 100 万个样本上进行预训练,展示了卓越的数据效率,成功防止了表示退化,并在不同的单模态和双模态下游任务中建立了新的最先进的性能,大大优于在更大的数据集上扩展的基础模型。