论文
检索增强医学问答的检索管道设计的系统研究
A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering
摘要
大语言模型(LLM)在医疗问答方面表现出了强大的能力;然而,纯参数模型常常存在知识差距和有限的事实基础。检索增强生成(RAG)通过将外部知识检索集成到推理过程中来解决这一限制。尽管人们对基于 RAG 的医疗系统的兴趣日益浓厚,但单个检索组件对性能的影响仍然没有得到充分的了解。本研究使用 MedQA USMLE 基准和基于教科书的结构化知识语料库对检索增强医学问答系统进行了系统评估。我们在包含四十种配置的统一实验框架内分析了语言模型、嵌入模型、检索策略、查询重构和跨编码器重新排名之间的交互。结果表明,检索增强显着提高了零样本医学问答性能。性能最佳的配置是带有查询重新制定和重新排名的密集检索,准确率达到 60.49%。研究还发现,与通用模型相比,领域专用语言模型能够更好地利用检索到的医学证据。该分析进一步揭示了检索有效性和计算成本之间的明显权衡,更简单的密集检索配置提供了强大的性能,同时保持了更高的吞吐量。所有实验均在单个消费级 GPU 上进行,表明可以在适度的计算资源下对检索增强型医疗 QA 系统进行系统评估。