论文

LocationAgent:通过将策略与证据同参数化知识解耦的分层图像地理定位智能体

LocationAgent: A Hierarchical Agent for Image Geolocation via Decoupling Strategy and Evidence from Parametric Knowledge

智能体系统Agent 架构与控制循环

摘要

图像地理定位旨在基于视觉内容推断拍摄地点。从根本上说,这构成一个由假设-验证循环组成的推理过程,要求模型同时具备地理空间推理能力和将证据与地理事实核验的能力。现有方法通常通过监督训练或基于轨迹的强化微调,将位置知识和推理模式内化到静态记忆中。因此,这些方法在开放世界设置或需要动态知识的场景中容易出现事实幻觉和泛化瓶颈。为应对这些挑战,我们提出分层定位智能体LocationAgent。我们的核心理念是将分层推理逻辑保留在模型内部,而将地理证据的核验卸载给外部工具。为实现分层推理,我们设计了RER架构(Reasoner-Executor-Recorder),采用角色分离和上下文压缩来防止多步推理中的漂移问题。对于证据核验,我们构建了一套线索探索工具,为位置推理提供多样证据。此外,针对现有数据集中的数据泄漏和中文数据稀缺问题,我们提出CCL-Bench(China City Location Bench),一个涵盖多种场景粒度和难度级别的图像地理定位基准。大量实验表明,LocationAgent在零样本设置下显著优于现有方法至少30%。

LocationAgent:通过将策略与证据同参数化知识解耦的分层图像地理定位智能体
图1:LocationAgent 框架概览。我们将图像地理位置定位重新表述为一个分层溯因推理过程。(a) Reasoner 在结构化动作空间内执行策略规划。(b) Executor 通过从外部工具获取多维证据,将推理与参数化知识解耦。(c) Recorder 维护状态一致性以防止推理漂移。