论文
用于经济高效检索模型选择的增量池 LLM 评估
Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection
摘要
为生产 RAG 系统选择检索模型需要可靠的比较评估,但大规模获得相关性判断成本高昂,并且随着新候选系统的出现而难以重复。我们研究了 LLM 池评估,其中 LLM 判断当前候选系统集检索到的文档的并集,然后随着新系统的引入,通过仅判断它们贡献的新文档来逐步扩展池。这些判断被重用来在共同的基础上评估所有系统。我们在 11 个涵盖密集、稀疏和混合配置的系统的 4 个检索基准上验证了这种方法,并将其部署来比较财经新闻 QA 系统的 62 个检索配置。汇总的 LLM 排名与跨数据集的金标准评估密切相关,一旦考虑到 qrel 中的引导不确定性,97% 的成对系统排序将被保留。在生产中,文档重叠可实现 65-80% 的判断重用,并将评估成本降低高达 4.9 倍,从而使团队能够对新的检索候选对象进行基准测试,而无需重新判断先前评估的文档。这些结果表明,LLM 汇总评估是一种实用且经济高效的工作流程,用于在已部署系统中进行增量检索模型选择。