论文

搜索代理何时应该询问:DiscoBench 用于澄清感知深度搜索

When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search

智能体系统Agent任务评测

摘要

由 大语言模型 (LLM) 提供支持的搜索代理越来越多地用于解决复杂的信息查找任务,需要多步骤检索和推理来实现用户目标。然而,现有的基准通常假设用户查询是完整且明确的,而忽略了现实世界的搜索请求经常是模糊的、不明确的、甚至实际上不正确的事实。在深度搜索场景中,这种歧义可能会沿着多步推理链传播,并导致智能体走向错误的搜索轨迹。为了弥补这一差距,我们引入了 DiscoBench,这是一种澄清感知深度搜索的基准,旨在评估搜索代理是否能够主动识别歧义,提出有效的澄清问题,并通过用户交互恢复正确的推理路径。 DiscoBench 包含 11 个现实世界领域的 211 个样本和 463 个歧义实例,涵盖四种歧义类型。我们进一步设计了用于多轮交互的用户模拟器,并从任务效用、歧义检测、交互策略和成本效率四个角度评估模型性能。对代表性 LLM 的实验表明,歧义检测和有效澄清是不同的能力,并且重复搜索而不是要求澄清通常比直接猜测表现更差,这凸显了当前搜索代理中检索能力和交互式问题解决之间的关键差距。