论文
文档检索器的系统性多领域评估
A Systematic Multi-Domain Evaluation of Document Retrievers
摘要
文档检索是许多现代人工智能系统的重要组成部分,直接影响其在下游任务中的有效性、稳健性和公平性。尽管近年来检索器的数量不断增加,但文献中的比较研究通常范围有限或集中于单一基准、领域或模型系列。这种碎片化使得很难就文档检索器的相对优势、劣势和权衡得出可靠的结论。为了解决这一差距,我们对文档检索器进行了大规模的实证评估,涵盖三个系列(稀疏、密集和基于扩展),并评估了七个 IR 数据集的 33 个检索器,分析检索质量、运行时间和故障点。我们不是单独调整每个模型,而是在可从其公共文档和统一计算预算重构的配置下评估每个现成的检索器。我们的结果表明,NV-Embed-v2 在七个数据集中的四个上实现了最强的性能,尽管是以大量查询延迟为代价的。在稀疏检索器中,我们发现 SPLADE-v3 可以与表现最好的方法相媲美,尽管延迟要低得多,甚至在 MS MARCO 上取得了最高分。在遵循指令的数据集上,GritLM 提供最佳性能。最后,对检索器失败点的分析揭示了模型和系列之间的对比,表明检索性能方面未实现的收益的潜力。