论文
被引用但未经验证:解析和评估 LLM 深度研究代理中的来源归因
Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents
摘要
大语言模型 (LLM) 为深度研究代理提供动力,将数百个网络来源的信息合成为引用的报告,但这些引文无法可靠地验证。目前的方法要么信任模型准确自引,但存在偏见,要么采用检索增强生成(RAG),但不验证来源的可访问性、相关性或事实一致性。我们引入了第一个来源归因评估框架,该框架使用可重复的 AST 解析器从 LLM 生成的 Markdown 报告中大规模提取和评估内联引用。与单独验证声明的方法不同,我们的框架通过检索实际引用的内容来闭合循环,使人类或模型评估者能够根据其来源来判断每个引用。引用沿着三个维度进行评估。 (1) Link Works 验证 URL 可访问性,(2) 相关内容衡量主题一致性,(3) 事实检查根据源内容验证事实准确性。我们使用通过人工审核校准的基于标题的 LLM 法官评估器,在三个评估维度上对 14 个闭源和开源 LLM 进行基准测试。我们的结果表明,即使是最强大的前沿模型也能保持 94% 以上的链接有效性和 80% 以上的相关性,但事实准确性仅达到 39-77%,而只有不到一半的开源模型一次性成功生成引用的报告。关于研究深度的消融研究表明,随着工具调用范围从 2 到 150,事实检查准确性在两个前沿模型中平均下降约 42%,这表明更多的检索并不会产生更准确的引用。这些发现揭示了表面引用质量和事实可靠性之间的严重脱节,我们的框架提供了评估基础设施来评估这种脱节。