论文

评估超越公制偏差的遥感图像说明

Evaluating Remote Sensing Image Captions Beyond Metric Biases

模型评测评测方法与指标

摘要

图像图像描述的核心目标是实现从视觉信号到文本模态的无损语义压缩。然而,对手动策划的参考文本进行评估的依赖本质上迫使模型模仿特定的人类注释风格,从而掩盖了高级基础模型的真实描述能力。这种系统性的失调引发了一个关键问题:特定任务的 微调 是否真的是遥感图像图像描述所必需的,或者感知到的性能差距仅仅是有缺陷的评估标准的产物?为了调查这种差异,我们提出了 ReconScore,一种新颖的无参考评估指标。我们不是计算文本相似性,而是通过其仅根据生成的文本重建原始视觉元素的能力来评估图像描述质量,从而有效地消除人类注释偏差。应用这个指标,我们发现了一个深刻的、违反直觉的事实:本质上强大的、未经微调的 MLLM 在真正的零样本 RSIC 任务中超越了经过微调的对应物。在这一结构发现的推动下,我们引入了 RemoteDescriber,这是一种完全的 无需训练 生成方法。通过采用 ReconScore 作为自我校正机制,我们迭代地细化 MLLM 输出的语义精度,而无需任何计算 微调 开销。综合实验表明 RemoteDescriber 在三个数据集上实现了最先进的性能。此外,我们验证了 ReconScore 的可靠性并分析了传统指标的缺陷。我们的代码可在 https://github.com/hhu-czy/RemoteDescriber 获取。