论文
检测和纠正商业 LLM 和深度研究代理中的参考幻觉
Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents
摘要
大语言模型 和深度研究代理提供引用 URL 来支持他们的主张,但这些引用的可靠性尚未得到系统测量。我们使用 DRBench 上的 10 个模型和代理(53,090 个 URL)以及 ExpertQA 上的 3 个模型(跨 32 个学术领域的 168,021 个 URL)解决了有关引文 URL 有效性的 6 个研究问题。我们发现 3--13\% 的引用 URL 是幻觉的——它们在 Wayback Machine 中没有记录,并且可能从未存在过——而 5--18\% 总体上是无法解析的。与搜索增强型 LLM 相比,深度研究代理每次查询产生的引用要多得多,但产生幻觉 URL 的比率更高。领域效应很明显:未解决率范围从 5.4\%(商业)到 11.4\%(神学),每个模型的效应甚至更大。分解失败表明,某些模型会伪造每个无法解析的 URL,而其他模型则显示大量链接失效分数,表明真正的检索。作为解决方案,我们发布了 urlhealth,这是一个使用 Wayback Machine 进行 URL 活跃度检查和过时与幻觉分类的开源工具。在代理自我校正实验中,配备 urlhealth 的模型将非解析引用 URL 减少了 $6\textrm{--}79\times$ 至 1\% 以下,尽管有效性取决于模型的工具使用能力。该工具和所有数据都是公开的。我们的特征研究结果、失败分类法和开源工具表明,引文 URL 的有效性既可以大规模测量,又可以在实践中纠正。