论文

RAG 系统中自适应 Top-k 文档检索的预检索查询聚类

Pre-retrieval Query Clustering for Adaptive Top-k Document Retrieval in RAG Systems

上下文与知识检索增强

摘要

RAG 系统通常检索固定数量的文档 (top-k) 到地面生成,但这种静态方法很脆弱:简单查询会过度检索(增加噪声和成本),而复杂查询检索不足,导致召回失败,进而导致错误答案。出于必须检索多少文档才能可靠地回答任意查询的问题,我们提出了一个实用的、通用的查询自适应检索深度框架。离线时,我们通过测量默认检索器下的 NDCG 并从 NDCG-k 曲线得出特定于查询的饱和点 k* 来估计每个查询的检索难度。由于在线计算这些信号的成本很高,因此我们在嵌入空间中对大量查询进行聚类,并使用均值加方差规则以高覆盖率(例如~95%)为目标的推荐检索深度来总结每个聚类。在运行时,系统将传入的查询分配给集群,并在恒定时间内选择相应的 top-k。与依赖于对检索到的文档进行聚类的检索后置信度方法相比,我们的方法是预检索和以查询为中心的,使其在异构、类案例语料库中具有鲁棒性,并且适用于法律、医疗保健、金融和企业搜索等领域。最后,该框架已经在全流量查询中进行了测试,将 $F_1$ 提高了 36% 以上,同时在低复杂性集群上将词元使用量减少了 14%,而没有损失准确性。