论文
SearchAuditor:长程搜索Agent的失效审计与归因
SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents
摘要
深度搜索代理通过长时间的网页交互解决复杂问题,这是一个既复杂又脆弱的过程:小的推理错误可能会沿着长且噪声的轨迹传播到流畅但错误的答案。诊断这些失败是困难的,需要手动检查极其长的执行轨迹,这可能超出了人类能力范围。因此,我们引入了SearchAuditBench,这是一个基准测试,用于评估LLM审计器是否能够定位、属性和修复这些失败,从而减轻人类负担。SearchAuditBench包含1,243个失败轨迹,平均每个轨迹有73.1条消息和65.1K个词元,从八个公开权重模型上收集的五个深度搜索基准测试中获取,每个模型都标注了关键错误步骤、搜索特定的根源原因以及参考修复(评分标准)。我们进一步提出了SearchAuditor,这是一个多视角审计框架,通过证据导向的裁决有效地定位、属性和修复搜索代理失败。实验结果表明,即使最强的基础线,在由如GPT-5.5这样的前沿模型驱动时,也仅达到26.6%的整体通过率。相比之下,我们的SearchAuditor在不同前沿模型上始终优于所有基准,整体通过率达到32.3%,并使审计器能够更好地从错误中恢复运行状态。
