论文

反思文献检索评估:Deep Research有帮助,而人类引文列表并非真值

Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth

应用与实践科学研究

摘要

我们从两个互补的角度研究大规模文献检索:改进检索流水线,以及把人类参考文献列表作为评估目标进行压力测试。首先,我们实现了一条Deep Research流水线,它处理查询论文的全文并沿检索结果的参考文献广度优先扩展,结果显示其大幅超越仅用API的朴素检索,把RollingEval-Jun25(一个250篇论文的文献检索基准)上的召回率从20%以下提升到80%以上。其次,我们使用中立的LLM-as-a-judge来判断人类参考文献是否是该任务的可靠真值。我们发现显著局限:只有51%的人类引文被评为中等相关或以上,而最强的AI重排序器为86-88%。我们在OpenAlex合著者图上研究这一差距,发现人类引用直接合作者的可能性是最强AI重排序器的2.5倍。综合来看,我们的结果反对单一维度的文献检索评估:召回率、主题相关性打分、排序列表多样性以及合著距离诊断各自衡量引用质量的互补属性,应当一并报告。

反思文献检索评估:Deep Research有帮助,而人类引文列表并非真值:论文配图
图 1:深度研究管道。该系统摄取完整的查询论文,生成 LLM 构建的关键字查询,从学术 API 检索种子论文,沿着引文链接扩展候选集,并对合并的候选进行重新排名。完整的算法和提示见附录 B。