论文

评估小型开放式 LLM 的医疗问答:实用框架

Evaluating Small Open LLMs for Medical Question Answering: A Practical Framework

模型评测评测方法与指标

摘要

将 大语言模型 (LLM) 纳入医疗问答需要的不仅仅是高平均准确度:每次查询都返回实质上不同答案的模型不是可靠的医疗工具。 Reddit 等在线健康社区已成为数百万用户医疗信息的主要来源,但它们仍然极易受到错误信息的影响;在这些设置中部署 LLM 作为助手增强了对输出一致性和正确性的需求。我们提出了一个实用的开源评估框架,用于评估小型、可本地部署的开放权重 LLM 的医学问答,将可重复性视为与词汇和语义准确性并列的一流指标。我们的管道计算八个质量指标,包括 BERTScore、ROUGE-L 和 LLM-as-judge rubric,以及来自重复推理的两个模型内再现性指标(每个问题 N=10 次运行)。对 50 个 MedQuAD 问题(N=1,500 总回答)的三个模型(Llama 3.1 8B、Gemma 3 12B、MedGemma 1.5 4B)进行评估表明,尽管产生低温(T=​​0.2),但运行间的自我一致性最多达到 0.20,而每个模型的所有输出中 87-97% 是唯一的,这是单通道基准测试完全忽略的安全差距。经过临床微调的 MedGemma 1.5 4B 在质量和再现性方面均低于较大的通用模型;然而,由于 MedGemma 也是最小的模型,因此这种比较混淆了域 微调 与模型规模。我们足够详细地描述了该方法,以便从业者复制或扩展他们自己的模型选择工作流程的评估。所有代码和数据管道均可在 https://github.com/aviad-buskila/llm_medical_reproducibility 获取。