论文

RemoteZero:零标签的地理空间推理

RemoteZero: Geospatial Reasoning with Zero Labels

模型训练强化学习

摘要

地理空间推理需要模型来识别满足复杂且通常隐式的用户意图的图像区域。最近的强化学习方法在没有手动注释推理痕迹的情况下改进了推理,但仍然需要人类提供的目标标签来构建奖励,限制了它们在大规模未标记的地球观测数据上的使用。我们介绍 RemoteZero,一个用于基于强化的地理空间推理的无标签框架。我们的主要观察结果有两个:MLLM 在评估候选者方面通常比生成解决方案更可靠,而航空图像则减少了区域级验证中的干扰。因此,RemoteZero 将每个预测区域转换为视觉裁剪,并使用其与查询的语义一致性作为 GRPO 优化的内在奖励。这种公式消除了对人类提供的解决方案标签的需要,并通过重用前一轮模型作为验证者来进一步支持迭代自我进化。实验表明,RemoteZero 的性能优于强监督基线,可有效应用于其他地球观测任务,并随着训练数据的扩展通过自我进化不断改进。我们希望这个方向能够广泛惠及地球观测界。