论文

深研究智能体哪里出错了?智能体踪迹中的跨度级错误定位

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

模型评测评测方法与指标

摘要

深度研究代理通过长期的搜索、工具使用、证据检查和答案综合来解决任务。基于最终答案的评估显示智能体是否成功,但不显示轨迹的哪些部分使答案不可靠。我们研究深度研究代理的跨级错误定位。我们从两个代理框架、三个骨干模型和三个基准中收集了 2,790 个真实轨迹,将原始日志转换为语义跨度,并通过大语言模型辅助专家评审注释有害错误跨度。根据这些注释,我们构建了 TELBench,这是一个包含 1,000 个实例的基准测试,用于识别正常探索、失败搜索、尝试性假设和无害噪声之间的错误范围。我们进一步提出 DRIFT,一个以声明为中心的审计框架,用于跟踪代理声明,检查其在轨迹证据中的支持,并标记不受支持或冲突的声明影响答案路径的范围。跨模型系列和审计框架的实验表明,DRIFT 将跨度级别的错误定位和首次错误准确率提高了高达 30 个百分点。我们的工作提供了深入研究代理的可靠性的过程级视图。

深研究智能体哪里出错了?智能体踪迹中的跨度级错误定位:论文配图
图 1:TELBench 的数据管理管道,涵盖轨迹收集、日志标准化、语义跨度分割、LLM 辅助候选标记和专家验证的错误注释。