论文

LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准与对齐

LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

模型训练强化学习

摘要

长时序地球观测推理要求模型组织多阶段地理演化、定位空间变化、检测时间异常,并从长图像序列推断未来。然而,现有遥感视觉语言模型主要关注孤立图像、图像对或短序列,限制了对相关帧与区域的可靠锚定。我们提出LongEarth-Bench,一个包含约12万问答样本、源自11.7万张独特图像的基准。其序列平均15.14帧、最长延伸到30帧,覆盖演化总结、空间推理、异常识别与逻辑预测共12类任务。一个3万样本子集进一步提供将关键帧与变化区域关联到最终答案的结构化推理轨迹。我们通过带显式序列标识符与结构化思维链监督的有监督微调开发LongEarth。在LongEarth基础上,LongEarth-R1应用带格式、时间与空间奖励的组相对策略优化。LongEarth-R1在全部12个长序列任务上取得最佳结果,同时在标准遥感基准上保持竞争力。

LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准与对齐:论文配图
图1:LongEarth-Bench 和 LongEarth-R1 的任务分类、基准定位与模型能力比较。(a) 归入四个认知维度的 12 个任务的代表性示例。(b) 平均序列长度与认知维度覆盖;气泡大小表示最大序列长度。(c) 代表性遥感方法的能力覆盖,包括长序列理解、演化描述、空间定位、时序诊断、逻辑预测和 CoT。