论文
LLM能否准确评分医学诊断和临床推理?
Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?
摘要
使用临床专家小组评估医疗人工智能系统成本高昂且速度缓慢,这促使人们使用 大语言模型 (LLM) 作为替代裁决者。在这里,我们评估了由三个前沿 AI 模型组成的 LLM 陪审团,对 300 个现实世界中低收入国家 (LMIC) 医院病例的 3334 个诊断进行评分。 LLM 和临床医生生成的诊断均根据专家小组诊断的四个维度进行评分:诊断、鉴别诊断、临床推理和阴性治疗风险。 LLM 评审团评分与专家和独立重新评分小组评分进行比较,以评估误差指标、评分者间一致性、严重风险误差以及使用等渗回归进行事后校准的效果。在我们的数据中,我们发现:(i)未校准的 LLM 陪审团评分与专家临床医生小组评分保持顺序一致,但系统性较低; (ii) LLM 评审团出现严重风险错误的概率低于人类专家重新评分小组; (iii)LLM陪审团与LLM诊断相结合,可用于识别高错误风险的诊断,从而实现有针对性的专家评审,提高专家组效率; (iv) 校准后的 LLM 陪审团评分和诊断试剂排名与主要专家小组的评分和排名非常一致; (v) LLM 陪审团模型没有表现出自我偏好偏差,他们对自己的底层模型或来自同一供应商的模型生成的诊断的评分并不比其他模型生成的诊断高(或低)。总之,这些结果证明,经过校准的 LLM 陪审团是医疗 AI 基准测试中专家临床医生评估的值得信赖且可靠的代理。在其他临床环境中证实这些发现是未来工作的重要方向。