论文

澄清然后搜索:具有端到端金块恢复的深度搜索的澄清基准

Clarify-Then-Search: A Clarification Benchmark for Deep Search with End-to-End Nugget Restoration

智能体系统Agent任务评测

摘要

深度搜索对于未指定的用户查询很脆弱:缺少时间、位置、范围或定义等约束可能会导致检索漂移和不完整的答案。我们引入了 Clarify-Then-Search,这是一个评估 LLM 生成的澄清问题是否提高下游深度搜索效用的基准。该基准测试以百度搜索引擎的真实查询数据为基础,包含 518 个精选实例,每个实例都有一个意图查询和一个相应的未指定查询。对于每个意图查询,我们运行一次 WebDancer 来存档证据并构建静态标准答案参照,作为带有可追踪源标识符的加权、基于证据的块。在评估时,澄清者询问 {1, 2, 3} 个问题中的 k 个问题;闭卷式用户应答器仅回复意图查询中明确说明的信息,否则返回未知;闭卷重写器仅使用未指定的查询和引出的问题-答案对来生成重写的查询。然后,WebDancer 执行重写的查询,我们使用restore_score_100 对端到端实用性进行评分,这是一个加权关键信息召回分数,对照静态参照给予部分得分。在所有评估的模型中,在 k=1 时,清晰度比无交互基线有所提高,并且更大的预算通常会带来更多收益。 GPT-5.2 在 k=1 时达到最高平均分数,而 ERNIE-4.5-Turbo-128K 在 k=3 时成为整体表现最好的模型。诊断揭示了一致的故障模式:许多系统过度询问仅限区域的问题,这些问题通常无法从意图中回答,从而引发未知。澄清然后搜索能够对澄清然后搜索管道进行防泄漏和可重复的评估,并对深度搜索中的问题效用、可回答性和预算效果进行细粒度分析。