论文
HyperVision:通道自适应的地面高光谱视觉预训练骨干
HyperVision: A Channel-Adaptive Ground-Based Hyperspectral Vision Pre-trained Backbone
摘要
虽然高光谱成像提供了数百个窄波段的丰富空间光谱信息,用于精确的材料识别,但地面高光谱预训练主干仍然不存在,受到传感器间不同光谱配置、有限注释和异构标签方案以及现有数据集有限规模和场景多样性的限制。为了应对这些挑战并实现普遍感知,我们提出了 HyperVision,这是第一个地面高光谱预训练骨干网。首先,为了处理不同的频谱配置,HyperVision 采用通道自适应动态嵌入机制将异构输入映射到统一的词元空间。其次,我们开发了一个无监督表示学习框架。具体来说,为了解决有限的注释和异构标记方案,引入了多源伪标记方法来融合来自 SAM2 的空间结构和来自 HyperFree 的细粒度光谱材料信息。此外,为了丰富场景多样性并补偿有限的数据集规模,利用跨模态 知识蒸馏 机制将丰富的语义表示从预训练的 RGB 视觉模型传输到我们的主干网络。 HyperVision 经过对来自 26 个不同地面数据集的 15,000 张图像进行预训练,展示了卓越的泛化能力。它只需要有效的头自适应而不调整主干参数,在不同传感器配置下的三个下游任务中优于最先进的特定于任务的方法,在高光谱语义分割 $\mathrm{Acc}_{\mathrm{M}}$ 中产生高达 16.3% 的相对改进,在对象跟踪 AUC 中相对增益 2.1%,在显着对象检测 MAE 中减少 35.5%。源代码和预训练模型可在 https://github.com/lronkitty/HyperVision 获取。