基于LLM评估的医疗大语言模型聊天机器人回答眼科患者问题的临床验证
Clinical Validation of Medical-based Large Language Model Chatbots on Ophthalmic Patient Queries with LLM-based Evaluation
摘要
领域专用大语言模型越来越多地被用于支持眼科中的患者教育、分诊和临床决策,使得严格的评估对确保安全性与准确性至关重要。本研究评估了四个小型医疗LLM——Meerkat-7B、BioMistral-7B、OpenBioLLM-8B和MedLLaMA3-v20——回答眼科相关患者问题的表现,并评估了基于LLM的评估相对临床医生评分的可行性。在这项横断面研究中,180个眼科患者问题由每个模型作答,共生成2160条回复。模型选择参数规模在100亿以下,以实现资源高效的部署。回复由三名不同资历的眼科医生以及GPT-4-Turbo按照S.C.O.R.E.框架评估,该框架考察安全性、共识与情境、客观性、可复现性和可解释性,采用五级李克特量表评分。LLM评分与临床医生评分之间的一致性用Spearman秩相关、Kendall tau统计量和核密度估计分析来评估。Meerkat-7B表现最佳,高级顾问医师给出的平均分为3.44,顾问医师为4.08,住院医师为4.18。MedLLaMA3-v20表现最差,25.5%的回复包含幻觉或临床上误导性的内容,包括捏造的术语。GPT-4-Turbo的评分总体上与临床医生评估高度一致,Spearman rho为0.80,Kendall tau为0.67,不过高级顾问医师的评分更为保守。总体而言,医疗LLM展现出安全回答眼科问题的潜力,但在临床深度和共识方面仍有差距,这支持了基于LLM的评估用于大规模基准测试的可行性,也表明需要混合自动化与临床医生审查的框架来指导安全的临床部署。