论文

SGR-Bench:面向状态门控检索的搜索智能体基准

SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval

智能体系统Agent任务评测

摘要

大语言模型与工具使用智能体的最新进展扩展了被基准化的网络任务范围。然而,一类重要的专业检索任务仍未被充分刻画。在许多专业数据检索网站上,承载答案的证据只有在通过过滤器、视图、层级或范围建立正确的站点特定检索状态后才变得可访问。我们将这种能力称为状态门控检索(state-gated retrieval, SGR)。我们提出SGR-Bench,一个面向该设定的基准,包含100个由专家策展的任务,横跨六个来源族与12个公共数据生态系统。每个任务要求发现合适的网站并配置其站点特定检索状态,以产出结构化答案。SGR-Bench为同一底层问题配对了约束引导式与目标导向式两种表述,使状态门控检索的显式与隐式引导之间能够进行受控比较。我们评估了八个基于CLI的智能体LLM系统与三个商业搜索智能体产品。在SGR-Bench上,最强的系统仅达到66.18%的item级F1,而行级F1还要低得多。对156条可分析的失败CLI轨迹的人工审计揭示了原因:智能体常常到达了相关的网络源,却建立了错误的站点特定检索状态。检索范围漂移(37.2%)与条件失配(27.6%)占主导,而最终答案组织仅占10.3%。数据集与单例评估说明见https://huggingface.co/datasets/PKUAIWeb/SGR-BENCH。

SGR-Bench:面向状态门控检索的搜索智能体基准:论文配图
图 1:SGR-Bench 四阶段数据管理管道概述。候选网站取自维基百科外部链接,优先考虑LLM,并在双重审查后保留。候选任务是根据六项要求设计协议从站点结构和检索控制中起草的,然后通过初步筛选和三轮专家验证来筛选答案的可识别性、状态门控检索的必要性和捷径阻力。