论文
诊断长程搜索Agent的搜索行为与失效模式
Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents
摘要
深度搜索代理通过迭代地发出搜索查询来解决困难的信息检索问题,但仍然不清楚更大的搜索努力是否会导致更好的答案。我们通过长期时间跨度的搜索代理诊断来研究这些问题。使用人类标注的文档相关性判断,我们评估每个搜索步骤中收集到的证据,并分离代理行为的两个阶段:代理检索到的证据和如何有效地使用这些证据。这一区分进一步允许我们将失败分为检索缺口,其中必要的证据从未被找到,以及利用缺口,其中相关的证据被检索到但未正确使用。在检索模型和评估平台保持不变的情况下,我们比较了六种代理在BrowseComp-Plus和进一步验证我们的发现的BrowseComp上的性能。在所有设置下,我们发现搜索努力和答案质量之间只有轻微的关联。答案准确度与检索到的证据的质量更强地相关,特别是累积检索召回率,而不是搜索次数或消耗的上下文量。有用的证据通常在轨迹的早期出现,但代理倾向于继续搜索,产生一个低效的检索步骤的长尾。在查询级别,探索性的重新表述仍然有用,但表现最好的代理发出的重复查询较少。总的来说,通过系统地刻画长期时间跨度的搜索代理的行为和失败模式,这项工作指出了构建更好深度研究系统的实际方向,包括更强的查询形式化、更有效的证据选择和上下文管理,以及基于是否已收集到足够的支持证据来停止的标准。