论文

评估非洲地区孕产妇和疫苗接种保健中的微调和基础语言模型

Evaluating Fine-Tuned and Base Language Models in Maternal and Vaccination Healthcare for African Settings

模型评测模型能力评测

摘要

背景:大语言模型 (LLM) 可以改善资源匮乏环境中的医疗保健信息传递,但可能会产生不准确或文化上不适当的建议。这项研究评估了尼日利亚针对孕产妇健康和疫苗接种的特定领域微调。目标:比较 HelpMum 的 MamaBot-Llama 和 Vax-Llama 与 Meta 的 Llama-3.1-8B-Instruct 的准确性、安全性、清晰度、上下文适当性和可信度。方法:我们评估了 200 个医疗保健问题,其中孕产妇健康和疫苗接种各 100 个问题,每个域分为 5 个子域。 MamaBot-Llama 和 Vax-Llama 分别使用低秩适应对超过 36,000 个孕产妇健康和 9,000 个疫苗问答对进行了微调。两名尼日利亚执业医师使用 5 点李克特量表独立评估反应。配对比较使用 Wilcoxon 符号秩检验。结果:性能因领域而异。 MamaBot-Llama 在所有标准上均显着优于基本模型,总体提高了 4.9% (p < .001),包括临床可信度 (+7%) 和医疗准确性 (+5%) 方面的提升。严重问题减少了 50%,临床医生在 78% 的病例中更喜欢它。相比之下,Vax-Llama 整体下降了 5.2% (p < .001),关键问题增加了 192%,安全问题增加了 400%。结论:当基于高质量、临床医生策划的数据时,特定领域的微调可以提高医疗保健大语言模型的表现,但当数据集质量不足时也可能会降低性能。在临床部署之前,严格的特定领域验证至关重要。医生评估人员提供了知情同意书,聊天机器人日志是匿名的。关键词:大语言模型;微调;孕产妇健康;疫苗接种;医疗保健人工智能;资源匮乏的环境;尼日利亚;模型评估;洛拉;医疗准确性