论文
超越 RGB:通过 无需训练 推理框架进行高光谱图像理解的基准测试和增强 MLLM
Beyond RGB: Benchmarking and Enhancing MLLMs for Hyperspectral Image Understanding via Training-Free Reasoning Framework
摘要
多模态 大语言模型 (MLLM) 在 RGB 图像理解方面取得了强大的性能,但它们使用可见光范围之外的光谱证据的能力在很大程度上仍未得到探索。高光谱图像 (HSI) 提供密集的光谱测量,可揭示 RGB 中无法提供的材料和环境线索,但当前的 MLLM 无法直接摄取高维 HSI。为了研究这一差距,我们引入了 HM-Bench,这是一种基于 MLLM 的高光谱图像理解的循证基准。 HM-Bench 包含来自 13 个任务类别的 2,178 个高光谱样本的 19,337 个问答对,涵盖一般感知、光谱推理和空间光谱推理。为了使 HSI 可访问现有 MLLM 的本机图像-文本接口,我们进一步提出了 VSR$^{2},一个 无需训练 视觉-光谱-报告推理框架。 VSR^{2} 用三个对齐视图表示每个 HSI 样本:用于视觉语义和空间上下文的 RGB 图像、用于主要光谱变化的基于 PCA 的图像以及用于定量光谱空间证据的结构化报告。在受控的仅 RGB 与 VSR^{2} 评估协议下,对 17 个代表性 MLLM 的实验表明,HSI 信息将平均准确度从 38.26% 提高到 40.35%,不同模型和任务类别的增益差异很大。这些结果表明 HSI 信息(超出 RGB)对于当前的 MLLM 很有用,而强大的高光谱推理仍然是一个开放的挑战。