论文

当检索没有帮助时:生物医学 RAG 的大规模研究

When Retrieval Doesn't Help: A Large-Scale Study of Biomedical RAG

模型评测模型能力评测

摘要

医疗问答是一个高风险的环境,事实错误可能会造成严重后果。检索增强生成(RAG)被广泛认为是一种有前途的解决方案,之前的工作已经报告了大型医学 QA 模型的巨大收益。我们在涵盖 7B 到 72B 参数的广泛开放权重指令调整模型中重新审视了这一假设。在五个模型、十个生物医学 QA 数据集、四种检索方法和四个检索语料库中,我们发现检索相对于无检索基线仅产生很小且不一致的改进,通常在 1-2 分之内。相比之下,主干模型的选择比 检索器 或语料库的选择具有更大的影响,并且专家和外行检索源在大多数设置中表现相似。这些结果表明,主要瓶颈不仅仅是检索质量,而是模型有效使用检索到的证据的能力有限。