论文

超越空间域监督:多模态图像融合的关系约束空间

Beyond Spatial-Domain Supervision: A Relation Constrained Space for Multi-Modal Image Fusion

模型训练奖励建模与过程监督

摘要

多模态图像融合(MMIF)旨在通过集成共享信息、保留互补线索以及协调跨模态冲突来形成单个图像。然而,由于缺乏真实融合图像,现有的 MMIF 监督通常使用空间域源或梯度变体作为替代真实图像,使得监督机制本质上与 MMIF 的目标不一致,并导致像素级妥协或模态偏差。为了解决这个问题,我们提出了一种关系约束的监督范式,将融合监督从空间域转移到学习的关系空间。我们不是仅仅依赖直接源近似,而是进一步利用冻结的预训练表示模型作为信息提供者,并设计一个可学习的特征适配器,将异构的 DINO 和 CLIP 特征对齐到统一的监督空间中。适配器推断出三个关系参数,即共享性、支配性和协调半径,它们定义了与 MMIF 目标相对应的三个损失。为了使这个空间可靠,我们设计了一个针对适配器的自监督对比排名目标,并通过交替优化将其与融合网络耦合。大量实验表明,无论融合网络采用哪种主流骨干网,所提出的监督空间都会产生显着的收益,从而提供更符合 MMIF 目标的监督范式。代码:github.com/GMY628/RCS-Fusion。