遥感世界模型旨在同时解释观测到的变化并预测合理的未来,这两项任务共享时空先验。然而,现有方法通常将二者分开处理,限制了跨任务迁移。我们提出RS-WorldModel,一个遥感统一世界模型,联合处理时空变化理解与文本引导的未来场景预测;并构建RSWBench-1.1M,一个包含110万样本、带丰富语言标注、覆盖两项任务的数据集。RS-WorldModel分三个阶段训练:(1)地理感知生成预训练(GAGP)让预测以地理与获取元数据为条件;(2)协同指令微调(SIT)联合训练理解与预测;(3)可验证强化优化(VRO)用可验证的任务特定奖励精炼输出。仅用2B参数,RS-WorldModel在大多数时空变化问答指标上超越了体积最大达其120倍的开源模型。它在文本引导的未来场景预测上取得43.13的FID,超越所有开源基线以及闭源的Gemini-2.5-Flash Image(Nano Banana)。
表 1:遥感理解和生成的数据集能力和规模比较。 ✓:支持; ✗:不支持; –:不适用(数据集不针对此任务类别)。图 3:RS-WorldModel 概述。该框架是通过三阶段管道训练的视觉语言世界模型:S1:元数据条件图像预测的地理感知生成预训练,S2:用于联合理解和预测的协同指令调整,S3:具有特定任务奖励的可验证强化优化。表2:5K子集上的时空变化问答结果。该表将 RS-WorldModel 与商业、开源和特定领域的基线进行了比较。第 4.1 节提供了基线参考。表 3:1.6K 子集上文本引导的未来场景预测结果。第 4.1 节中提供了基线参考。表 4:参考遵守权重 λ\lambda 的消融。对1.6K子集进行预测;图 4:时间变化理解的定性比较。图 5:文本引导卫星图像预测任务的定性比较。给定详细的文本提示,与强基线相比,RS-WorldModel 生成的图像具有卓越的结构保真度、阴影一致性和场景真实感。表 5:三阶段训练范例的消融。对1.6K子集进行预测;对 5K 子集的理解。 *仅 GAGP 使用元数据调节,无需文本指令。表 6:GAGP 中的地理元数据消融。 1.6K 子集上的 FID。图 6:预测任务 (TFSF)。文本引导的未来场景预测子集的标记长度分布(左)和频繁术语的词云(右)。图 7:理解任务 (ST-CQA)。时空变化问答子集的标记长度分布(左)和频繁术语的词云(右)。图 8:ST-CQA 案例研究。使用 GPT 分数对响应进行建模。 RS-WorldModel 取得了最佳成绩。图 9:TFSF 案例研究。生成三个文本指令的结果。 RS-WorldModel 获得了最高的基于 GPT 的分数。 图 10:在可扩展数据构建管道中使用 Qwen3-VL-32B-Instruct 生成草稿的提示模板。图 11:在数据构建管道中使用 Qwen2.5-72B-Instruct 进行文本细化的提示模板。图 12:GPT-5-Nano 用于计算时空变化理解 (ST-CQA) 的 GPT-Score 的提示图 13:第 1 阶段(地理感知生成预训练,GAGP)中 RS-WorldModel 的系统提示。图 14:第 2 阶段(协同指令调优)和第 3 阶段(可验证强化优化)中使用的 RS-WorldModel 的系统提示。图 15:GPT-4o 使用提示来计算文本引导的未来场景预测 (TFSF) 任务的基于 GPT 的分数。 16:基于 Qwen3-30B-A3B-Instruct-2507 的 LLM-as-a-Judge 提示模板,用于可验证的强化优化 (VRO)。