论文

深度搜索中的委托智能:用于解耦能力诊断的可控框架

Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis

智能体系统Agent任务评测

摘要

深度搜索正在成为现代代理系统的核心功能,但通常仅根据端到端答案准确性对其进行评估。这种耦合的评估范式涉及检索质量、长上下文理解、证据验证和工具使用决策,使得很难确定模型是否真正知道何时以及如何将寻求搜索的信息委托给搜索。为此:(1)我们将这种元能力形式化为深度搜索中的委托智能,并将其分解为互补的维度——搜索决策(认识到信息不足并决定是否、何时以及如何搜索)和信息合成与验证(聚合来自多个来源的证据,判断来源可靠性,并在嘈杂、潜在对抗性条件下合成信息)。 (2) 为了实现解开和可重复的测量,我们开发了一个基于文档的逆向工程的可控合成管道。这产生了构建受控深度搜索评估的通用方法,而不是单个固定数据集。 (3) 作为一个具体实例,我们构建了 DelegSearchBench,以及一个解开的评估协议,该协议通过不同的文档组成和工具访问来隔离每个能力维度。 (4) 在代表性模型中,我们证明深度搜索能力不能仅通过最终答案的准确性来充分表征......

深度搜索中的委托智能:用于解耦能力诊断的可控框架:论文配图
图 1:可控合成管道概述:逆向工程查询合成、证据对齐干扰项生成和多标准拒绝过滤。通过所有自动过滤器的项目进入候选基准池,其剩余质量随后通过分层人工审核进行评估。来自阶段 A 的不相关检索文档被保留为自然背景噪声以进行搜索评估。详细内容请参见正文。