论文

GeoAgent:借助强化地理特征学习在任何地方进行地理定位

GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics

模型训练强化学习Agentic RL

摘要

本文提出 GeoAgent,一个能够进行接近人类的推理并得出细粒度地址结论的模型。以往基于强化学习(RL)的方法在性能与可解释性上取得突破,但其依赖 AI 生成的思维链(chain-of-thought,CoT)数据及与地理特性相冲突的训练策略,仍存在隐忧。为解决这些问题,我们首先推出 GeoSeek,一个由地理专家与职业玩家标注 CoT 数据的新地理定位数据集。我们进一步深入探索地理任务的内在特性,提出地理相似性奖励以及由一致性智能体评估的一致性奖励来辅助训练。这促使模型从地理视角收敛到正确答案,同时确保其推理过程的完整性与一致性。实验结果表明,GeoAgent 在多个粒度上优于现有方法与一系列通用 VLLM,并生成与人类高度一致的推理。

GeoAgent:借助强化地理特征学习在任何地方进行地理定位
图2:GeoAgent 的数据构建与训练流水线。GeoSeek-CoT 包含 10k 条由地理专家和地理定位游戏玩家标注的高质量推理过程。GeoSeek-Loc 包含 20k 张图像,用于 GeoAgent-SFT 的冷启动。在基于 GRPO 的训练中,我们以 GeoAgent-SFT 为基础,设计地理相似性奖励(geo-similarity reward),鼓励模型在物理和语义两方面都向正确答案收敛。此外,还引入一致性奖励(consistency reward)以保持 CoT 的完整性和一致性。