论文
将多模态 大语言模型 应用于红外-可见光图像融合质量评估
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
摘要
红外-可见光图像融合(IVIF)旨在将热信息和详细的空间结构集成到单个融合图像中以增强感知。然而,现有的评估方法往往会过度优化手工制作的无参考统计数据和将源图像视为伪地面事实的全参考指标。最近的 IVIF 奖励建模工作从人类评分中学习,但在聚合分数上使用标量回归,既不利用多模态 大语言模型 (MLLM) 的推理,也不在其监督中编码每个图像的感知模糊性,而是天真地引入具有离散单热监督的 MLLM,同样将相似质量的融合图像折叠为不同的评分级别。为了解决这个问题,我们引入了 FuScore,它利用 MLLM 通过产生连续的质量得分(而不是离散的水平预测)来模仿人类视觉感知,从而能够对相似质量的融合图像进行细粒度区分。我们利用四个 IVIF 特定子维度之间的一致性来构建每个图像的软标签,其清晰度反映了整体判断的共识程度。我们进一步引入了一个三方目标,结合了每图像分布监督、方法级排序的源对内瑟斯通保真度以及跨场景的场景级排序的跨源对瑟斯通保真度。大量实验表明,FuScore 实现了与人类视觉偏好最先进的相关性。