生物医学检索增强生成的基准检索策略:一项对照实证研究
Benchmarking Retrieval Strategies for Biomedical Retrieval-Augmented Generation: A Controlled Empirical Study
摘要
检索增强生成 (RAG) 提供了一条完善的途径来将 大语言模型 (LLM) 输出扎根于外部知识,但哪种检索策略在生物医学等高风险领域最有效的问题尚未得到应有的受控、多指标处理。本文对生物医学问答 RAG 管道中的五种检索策略(密集向量搜索、混合 BM25 + 密集检索、交叉编码器重排序、多查询扩展和最大边际相关性 (MMR))进行了系统的实证比较。所有策略共享固定生成模型 (GPT-4o-mini)、通用向量存储 (ChromaDB) 和 OpenAI 的 text-embedding-3-small 嵌入,确保观察到的差异仅归因于检索。使用四个 DeepEval 指标对来自 BioASQ 基准 (rag-mini-bioasq) 预处理子集的 250 个问答对进行评估:上下文精度、上下文召回、忠实性 和答案相关性,每个指标的置信区间为 95%。无上下文消融作为下限包括在内。交叉编码器重排序实现了最佳综合得分 (0.827) 和最高上下文精度 (0.852),证实查询-文档交互产生可测量的检索增益。多查询扩展尽管其以召回为导向的设计,但产生的上下文精度最弱(0.671),这表明朴素的查询多样化会引入检索噪声。 MMR 牺牲了答案的相关性以换取多样性,而密集基线(综合 0.822)落在顶级策略的 0.005 点以内。所有 RAG 条件在答案相关性方面都显着优于无上下文消融(0.658-0.701 与 0.287),证实了检索的实际价值。完整的流程、超参数和评估代码都是公开的。