论文
SGPDFuse:语义引导物理解纠缠通用多模态图像融合
SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion
摘要
多模态图像融合 (MMIF) 旨在将互补的传感器数据集成到单一表示中,从而保留内在场景现实,同时消除环境干扰。大多数现有方法依赖于盲特征聚合,这种方法擅长信号积累,但无法区分基本内容和物理退化。我们提出了 SGPDFuse,它通过建立在预训练视觉基础模型上的语义物理参数桥(SPPB)将输入映射到物理分离的结构表示中,从而弥补了这一差距,利用内在变化原理将不变的场景属性与瞬态环境因素解耦。为了指导这种分解,我们引入了语义对齐机制:我们通过余弦相似性将融合表示显式锚定到同一基础模型特征空间中的显着语义特征,以保留关键目标,同时通过格拉姆矩阵正则化强制物理纹理保真度,以严格消除不自然的伪影。大量实验表明,SGPDFuse 使用单一架构在红外-可见光、多焦点和多重曝光基准测试中实现了最先进的性能。