论文

AlignJEPA:遥感基础模型的预测视觉语言对齐

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

模型训练参数高效训练

摘要

遥感 (RS) 基础模型提供了跨传感器、分辨率和地理位置的可转移地球观测表示,但大多数模型与自然语言的一致性较差,限制了自然语言档案搜索、图像文本检索和问题条件分析。我们提出了 AlignJEPA,这是一种受 JEPA 启发的用于遥感基础模型的预测视觉语言对齐框架。 AlignJEPA 使用预训练的 AnySat 视觉编码器和 RemoteCLIP 文本编码器,同时仅训练轻量级预测对齐网络。该框架不是仅仅依赖于全局图像-文本对比对齐,而是从屏蔽的视觉基础模型标记中预测遥感文本嵌入。其掩模感知多尺度预测对齐器在精细、区域和全球尺度上聚合可见标记,使用跨尺度 Transformer 对其进行联合建模,并使用学习的查询池将结果表示投影到文本空间中。训练将语义预测与双向对比检索相结合。我们在 BigEarthNet.txt 上训练和评估 AlignJEPA 以进行自然语言 Sentinel 检索,评估 RSICD 上的跨数据集适应,并仅使用 RSVQA 作为闭集表示探针。 AlignJEPA 提供了一种参数有效的途径,用于将地球观测基础模型与语言对齐。