评估 LLM 临床实践指南多轮对话中检测和遵守情况的十年规模基准
A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations
摘要
临床实践指南 (CPG) 在确保基于证据的决策和改善患者治疗结果方面发挥着关键作用。虽然 大语言模型 (LLM) 越来越多地部署在医疗保健场景中,但尚不清楚 LLM 在对话过程中可以在多大程度上识别并遵守 CPG。为了解决这一差距,我们引入了 CPGBench,这是一个自动化框架,对 LLM 在多轮对话中的临床指南检测和遵守能力进行基准测试。我们收集了过去十年中来自 9 个国家/地区和 2 个国际组织发表的 3,418 篇 CPG 文献,涵盖 24 个专业。从这些文档中,我们提取了 32,155 条临床建议,以及相应的发布机构、日期、国家、专业、推荐强度、证据级别等。相应地为每条建议生成一个多轮对话,以评估 8 个领先的 LLM 的检测和依从能力。我们发现,71.1%-89.6%的推荐可以被正确检测到,而只有3.6%-29.7%的相应标题可以被正确引用,揭示了了解指南内容和它们来自哪里之间的差距。不同模型的遵守率从 21.8% 到 63.2% 不等,表明了解指南和能够应用指南之间存在很大差距。为了确认我们自动分析的有效性,我们进一步对来自不同专业的 56 名临床医生进行了全面的人体评估。据我们所知,CPGBench 是第一个系统地揭示 LLM 在对话过程中未能检测到或遵守哪些临床建议的基准。鉴于每项临床建议都可能影响大量人群,并且临床应用本质上对安全性至关重要,因此解决这些差距对于在现实世界临床实践中安全、负责任地部署 LLM 至关重要。