论文
LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准与对齐
LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning
摘要
长时序地球观测推理要求模型组织多阶段地理演化、定位空间变化、检测时间异常,并从长图像序列推断未来。然而,现有遥感视觉语言模型主要关注孤立图像、图像对或短序列,限制了对相关帧与区域的可靠锚定。我们提出LongEarth-Bench,一个包含约12万问答样本、源自11.7万张独特图像的基准。其序列平均15.14帧、最长延伸到30帧,覆盖演化总结、空间推理、异常识别与逻辑预测共12类任务。一个3万样本子集进一步提供将关键帧与变化区域关联到最终答案的结构化推理轨迹。我们通过带显式序列标识符与结构化思维链监督的有监督微调开发LongEarth。在LongEarth基础上,LongEarth-R1应用带格式、时间与空间奖励的组相对策略优化。LongEarth-R1在全部12个长序列任务上取得最佳结果,同时在标准遥感基准上保持竞争力。
