论文
BM25 大规模获胜:检索增强生成范式的规模研究
BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
摘要
检索增强生成(RAG)涵盖词汇检索和密集检索、基于图的索引和代理搜索,但这些范例通常在一种语料库大小的不同基准上进行评估,导致其准确性成本缩放比例不清楚。为了弥补这一差距,我们提出了一项对照研究,该研究沿着 28 个严格嵌套的层(跨越大约 450 倍)改变语料库大小,同时保持问题和相关和对抗性文档的固定基础不变。在一种读者模型和一种判断协议下,我们测量官方准确性、构建和查询词元以及延迟。结果揭示了规模相关的交叉而不是无条件的获胜者。文件系统代理在最小的共享层中处于领先地位,但其顺序探索在基础上的查询词元成本是原来的 39 倍,并且随着搜索空间的增长而变得不那么有效。大约 1000 万个语料库词元,BM25 超越了它,并在每个更大的共享层中领先,全面领先接近 20 个百分点。 BM25 还锚定了帕累托前沿的低成本端,无需基于 LLM 的构造。密集检索仍然有效,但准确性较低,而基于图的 RAG 在部署规模之前遇到了施工壁垒,并且其可扩展变体在共享层上仍低于 BM25。总体而言,语料库的增长越来越有利于全球候选排名:词汇检索是最强的可扩展默认值,而代理推理在排名发现之后而不是取代它时效果最好。