论文
GeoX:通过自博弈与可验证奖励掌握地理空间推理
GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards
摘要
地理空间推理需要围绕场景的复杂空间结构求解基于图像的问题。然而,为庞大且呈组合式的问题空间做标注的成本阻碍了这一能力的开发。我们提出GeoX,一个通过产生可验证奖励的可执行程序来习得空间逻辑的自博弈框架,无需依赖大规模人工整理数据。给定卫星或航拍图像,我们的框架采用单一多模态策略,将空间问题提议为可执行程序,并在溯因、演绎与归纳三种推理模式下,围绕空间原语与图像理解工具求解这些问题。验证器执行每个程序以转换出奖励信号,通过强化学习联合优化这两个角色。GeoX使其基础VLM平均持续提升最多5.5分,达到或超过用数百万条整理数据训练的传统基线。除所提方法外,我们还发布了一个通过自博弈积累的地理空间理解基准。
