面向临床 AI 评估的病例特定评分量规:跨 823 例诊疗的方法学、验证与 LLM-临床医生一致性
Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters
摘要
目的:临床 AI 文档系统需要在临床上有效、经济上可行且对迭代变更敏感的评估方法。需要专家逐次评分审查的方法对于安全的迭代部署而言过于缓慢和昂贵。我们提出一种用于临床 AI 评估的病例特定、由临床医生撰写的评分量规(rubric)方法,并检验 LLM 生成的量规能否逼近临床医生的一致性。材料与方法:20 名临床医生为覆盖初级保健、精神科、肿瘤科和行为健康领域的 823 个临床病例(736 个真实病例、87 个合成病例)撰写了 1,646 条量规。每条量规均通过以下方式验证:确认基于 LLM 的评分智能体会一致地给临床医生偏好的输出打出高于被否弃输出的分数。我们在全部病例上评估了嵌入电子健康档案(EHR)的面向临床医生 AI 智能体的七个版本。结果:临床医生撰写的量规能有效区分高质量与低质量输出(中位分数差距:82.9%),且评分稳定性高(中位极差:0.00%)。中位分数从 84% 提升至 95%。在后续实验中,临床医生与 LLM 的排序一致性(tau:0.42-0.46)达到甚至超过临床医生之间的一致性(tau:0.38-0.43),这可归因于天花板压缩效应与 LLM 量规的改进。讨论:这种趋同支持将 LLM 量规与临床医生撰写的量规结合使用。在成本约低 1,000 倍的情况下,LLM 量规能够大幅扩大评估覆盖面,而持续的临床撰写使评估植根于专家判断。天花板压缩效应对未来评分者间一致性研究构成了方法学挑战。结论:病例特定量规为临床 AI 评估提供了一条保留专家判断、同时以低三个数量级的成本实现自动化的路径。临床医生撰写的量规确立了基线,LLM 量规以此为基准得到验证。
