论文

领域 微调 与医学多项选择题问答的检索增强生成:4B 参数规模的受控比较

Domain Fine-Tuning vs. Retrieval-Augmented Generation for Medical Multiple-Choice Question Answering: A Controlled Comparison at the 4B-Parameter Scale

模型评测模型能力评测

摘要

部署小型开放权重 大语言模型 (LLM) 进行医疗问答的从业者面临着一个反复出现的设计选择:投资领域微调模型,或保留通用模型并通过检索增强生成 (RAG) 在推理时注入领域知识。我们通过固定模型大小、提示模板、解码温度、检索管道和评估协议来隔离这种权衡,并且仅改变 (i) 模型是否已适应领域(Gemma 3 4B 与 MedGemma 4B,均为 4 位量化并通过 Ollama 提供服务)和 (ii) 是否将从医学知识语料库中检索到的段落插入到提示中。我们在完整的 MedQA-USMLE 4 选项测试分组(1,273 个问题)上评估此 2x2 设计的所有四个单元,每个问题重复 3 次(15,276 个 LLM 调用)。与一般 4B 基线相比,域 微调 的多数票准确率提高了 +6.8 个百分点(53.3% vs. 46.4%,McNemar p < 10^-4)。 RAG 相对于 MedMCQA 解释在任一模型中都不会产生统计上显着的增益,并且在域调整模型中,点估计值略为负(-1.9 pp,p = 0.16)。在这个规模和这个基准上,以权重编码的领域知识主导了上下文中提供的领域知识。我们发布了完整的实验代码和 JSONL 跟踪以支持复制。