论文

GeoX:通过自博弈与可验证奖励掌握地理空间推理

GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

模型训练强化学习RLVR

摘要

地理空间推理需要围绕场景的复杂空间结构求解基于图像的问题。然而,为庞大且呈组合式的问题空间做标注的成本阻碍了这一能力的开发。我们提出GeoX,一个通过产生可验证奖励的可执行程序来习得空间逻辑的自博弈框架,无需依赖大规模人工整理数据。给定卫星或航拍图像,我们的框架采用单一多模态策略,将空间问题提议为可执行程序,并在溯因、演绎与归纳三种推理模式下,围绕空间原语与图像理解工具求解这些问题。验证器执行每个程序以转换出奖励信号,通过强化学习联合优化这两个角色。GeoX使其基础VLM平均持续提升最多5.5分,达到或超过用数百万条整理数据训练的传统基线。除所提方法外,我们还发布了一个通过自博弈积累的地理空间理解基准。

GeoX:通过自博弈与可验证奖励掌握地理空间推理:论文配图
(a) VQA 基准测试的表现(b) 范式比较图 1:地位和动机。 (a) 在使用零策划训练数据的情况下,GeoX 在 VQA 基准上优于之前的 VLM; (b) 常规工作从人工设计的模板中得出问题,并在外部注释答案,将它们限制在预定义的模式中。我们的框架用自主的自我游戏取代了这种范式,其中单个模型提出问题,其答案经过编程验证,将它们扩展到组合模式。