论文
Q2D-Web:代理 RAG 系统检索的大规模基准
Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems
摘要
评估大规模生产 RAG 中的第一阶段 检索器 需要一个基准,该基准将大规模语料库与基于真实用户查询及其对话线程的大量代理重新制定的搜索查询配对,并为每个查询标记许多相关文档。现有的公共基准测试没有评估此设置:大规模集合通常仅提供少量评估查询,而具有许多查询的基准测试通常仅包含数百万个文档。此外,大多数基准测试评估人工编写的查询,而代理 RAG 管道中的第一阶段 检索器 服务于机器编写的重构,其分布与人类搜索行为不同。为了克服这些评估差距,我们引入了 Q2D-Web (Query2Doc-Web),这是一个大规模代理检索基准,由 1.9 亿文档网络语料库和 10 种语言的 70k 代理搜索查询组成,根据生产系统中的真实用户查询重新制定。 Q2D-Web 提供三组固定相关性判断:代理引用、生产排名以及组合两个信号并添加对未标记的合并文档的基于 LLM 的判断以减少漏报的组合集。我们对 13 个 检索器 进行了基准测试,包括词汇模型、密集模型和后期交互模型,发现它们的相对顺序对判断集的选择很大程度上不敏感,同时在主题领域、查询语言和查询类型之间存在很大差异。为了实现快速评估,我们还研究了子语料库采样作为全语料库评估的近似。保留三分之一的语料库(通过汇集 检索器 运行的倒数排名融合选择)保留了组合判断下的全语料库模型排名,同时仅将绝对 Recall@1000 提高了 3 到 7 分。公共排行榜可在以下位置访问:https://huggingface.co/spaces/perplexity-ai/q2d-web-leaderboard