论文
SpotAgent:通过Agentic推理锚定大型视觉-语言模型的视觉地理定位
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
摘要
大型视觉-语言模型(LVLM)在地理定位上展现了强大的推理能力,但在视觉线索稀疏、长尾且高度模糊的真实场景中常常表现吃力。以往方法受制于内部知识,往往无法提供可验证的结果,在面对混杂证据时给出自信却无依据的预测。为应对这些挑战,我们提出SpotAgent,该框架把地理定位形式化为一个Agentic推理过程,利用专家级推理使视觉解读与工具辅助验证相协同。SpotAgent通过ReAct图式利用外部工具(如网络搜索、地图)主动探索并验证视觉线索。我们引入三阶段后训练流程:先以监督微调(SFT)阶段实现基本对齐,随后是Agentic冷启动阶段,利用通过多智能体框架合成的高质量轨迹,旨在灌输工具调用专长。随后,通过强化学习精炼模型的推理能力。我们提出空间感知动态过滤策略,依据空间难度优先处理可学习样本,以提升强化学习阶段的效率。在标准基准上的大量实验表明,SpotAgent取得最先进性能,在有效缓解幻觉的同时提供精确且可验证的地理定位。
