论文
适应还是不适应,重新思考医学知识意识的价值 大语言模型
To Adapt or not to Adapt, Rethinking the Value of Medical Knowledge-Aware Large Language Models
摘要
背景:最近的研究表明,领域适应型 大语言模型 (LLM) 在标准医学基准上并不总是优于通用型同类产品,这引发了关于是否需要专门的临床适应的问题。方法:我们在一组不同的英语和西班牙语多项选择临床问答任务上系统地比较一般和临床 LLM。我们引入了一种基于扰动的评估基准,用于探究模型的鲁棒性、指令遵循性以及对对抗性变化的敏感性。我们的评估包括一步和两步问题转换、多重提示测试和指导引导评估。我们分析了一系列最先进的临床模型及其通用模型,重点关注基于 Llama 3.1 的模型。此外,我们还介绍了 Marmoka,这是一个用于英语和西班牙语的轻量级 8B 参数临床 LLM 系列,通过对医学语料库和指令进行持续的领域自适应预训练而开发。结果:实验表明,即使在提出的基于扰动的基准下,临床 LLM 在英语临床任务上也并不始终优于其通用对应物。然而,对于西班牙语子集,与 Llama 相比,所提出的 Marmoka 模型获得了更好的结果。结论:我们的结果表明,在当前的简短 MCQA 基准下,临床 LLM 相对于英语通用模型仅提供边际且不稳定的改进,这表明现有的评估框架可能不足以捕获真正的医学专业知识。我们进一步发现,一般模型和临床模型在指令遵循和严格的输出格式方面都表现出很大的局限性。最后,我们证明可以为西班牙语等资源匮乏的语言成功开发强大的医学 LLM,Marmoka 模型证明了这一点。