论文

谁是智能体的罪魁祸首?代理深度研究中的 忠实性 和引用错误本地化

Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research

智能体系统Agent任务评测

摘要

深度研究 (DR) 系统通过协调多个代理从网络搜索和合成信息来生成长篇引用报告。引用是评估这些报告的 忠实性 的主要机制,但当前的 DR 系统的引用召回率很差。此外,提高引文召回率具有挑战性,因为 DR 系统是复杂的多代理架构,其中信息像电话游戏一样通过代理传递,内容和引文都可能在此过程中被损坏。我们提出了一种评估方法,通过本地测试 忠实性 的代理调用以及相对于其自身输入的可验证性来查明哪个代理引入了每个错误。此外,我们提出了四种类型的分类法来对发现的错误进行分类:幻觉、未引用的输入依赖、未引用的输出或引用不足。将我们的方法应用于三个顶级开源灾难恢复系统,我们获得了可行的诊断。几乎每个代理都会犯很多错误,但总结单个文档的错误除外。我们发现,主要错误类型在不同代理之间存在系统性差异,其中协调器错误主要与引用相关。我们发现 AI-Q 中 84.7% 的最终报告错误源自编排者,其中大约 31% 是幻觉,其余是引用错误。在这些见解的指导下,我们证明了两种简单的干预措施可以在不降低输出质量的情况下将引文召回率提高 5%。