论文

GeoBrowse:带有专家注释推理轨迹的代理工具使用的地理定位基准

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces

智能体系统Agent任务评测

摘要

深度研究代理通过多步骤工具的使用来整合零散的证据。 BrowseComp 为此类代理提供了纯文本测试平台,但现有的多模式基准测试很少需要弱视觉线索组合和 BrowseComp 风格的多跳验证。地理定位是一个天然的测试平台,因为答案取决于组合多个模糊的视觉线索并使用开放网络证据对其进行验证。因此,我们引入了 GeoBrowse,这是一种将视觉推理与知识密集型多跳查询相结合的地理定位基准。 Level 1 测试提取和组合碎片化的视觉线索,Level 2 通过注入长尾知识和混淆关键实体来增加查询难度。为了支持评估,我们提供了一个代理工作流程 GATE,其中包含五个图像思考工具和四个知识密集型工具,并发布基于可验证证据的专家注释逐步跟踪,用于轨迹级分析。实验表明,GATE 的性能优于直接推理和开源代理,这表明无工具、仅搜索或仅图像设置是不够的。收益来自于连贯的、特定于级别的工具使用计划,而不是更多的工具调用,因为它们更可靠地达到带注释的关键证据步骤,并且在集成到最终决策中时犯的错误更少。 GeoBrowse 基准标记和代码在 https://github.com/ornamentt/GeoBrowse 中提供