论文
大语言模型在医疗保健领域的比较分析
Comparative Analysis of Large Language Models in Healthcare
摘要
背景:大语言模型 (LLM) 因其理解、生成和总结复杂医学文本的能力而正在改变医疗保健领域的人工智能应用。它们为临床医生、研究人员和患者提供了宝贵的支持,但它们在高风险临床环境中的部署引起了对准确性、可靠性和患者安全的严重担忧。尽管近年来受到广泛关注,但 LLM 在医疗应用中的标准化基准测试仍然有限。目的:本研究解决了在医疗环境中对 LLM 进行标准化比较评估的需要。方法:我们使用开放数据集、MedMCQA、PubMedQA 和 Asclepius 评估多个模型(包括 ChatGPT、LLaMA、Grok、Gemini 和 ChatDoctor)在患者笔记摘要和医疗问答等核心医疗任务上的表现,并通过语言和特定任务指标的结合来评估性能。结果:结果表明,ChatDoctor 等特定领域模型在上下文可靠性方面表现出色,可生成医学上准确且语义一致的文本,而 Grok 和 LLaMA 等通用模型在结构化问答任务中表现更好,表现出更高的定量准确性。这凸显了特定领域和通用 LLM 根据医疗任务的互补优势。结论:我们的研究结果表明,LLM 可以为医疗专业人员提供有意义的支持并增强临床决策;然而,它们的安全有效部署需要遵守道德标准、上下文准确性以及相关情况下的人工监督。这些结果强调了针对特定任务的评估以及将 LLM 谨慎集成到医疗保健工作流程中的重要性。