论文
大语言模型与中医医师:真实临床案例评估
Large Language Models Versus Physicians in Traditional Chinese Medicine: A Real-World Clinical Case Evaluation
摘要
大语言模型 (LLM) 越来越多地被探索用于临床应用,但其对真实世界中医 (TCM) 实践的评估仍然有限。我们构建了一个临床病例库,其中包含来自 62 家医院的 349 个去识别的门诊病例,并使用从该库中选择的 60 个代表性病例对 16 个 LLM 和 60 名执业中医医师的比较队列进行了评估。模型输出和医生报告由五位资深中医专家在九个诊断和治疗维度进行匿名和评分。尖端的通用大语言模型比医生对照者获得了更高的专家分数,特别是在医疗建议、治疗原则和选定的诊断任务方面。然而,处方级分析揭示了草药选择、剂量和治疗策略方面的差异,定性安全审查发现了幻觉和不良的模板驱动输出。这些发现凸显了大语言模型在中医决策支持方面的潜力,同时强调了医生监督、安全限制和前瞻性临床评估的必要性。