论文
GlobalDentBench:经专家校准、评估LLM牙科临床推理的多国基准
GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration
摘要
尽管大语言模型(LLM)具有变革医学的潜力,但其在真实临床场景中的推理稳健性与安全性仍严重缺乏研究,牙科领域尤甚。本文介绍GlobalDentBench,首个多国牙科基准,其分类体系涵盖六大洲88个国家和地区的14个牙科专科。该基准包含8,978道经专家验证的题目,覆盖三种形式(多选题、简答题和基于病例的题目),并评估三个递进的推理层级:知识回忆(L1)、常规推理(L2)和个性化推理(L3)。为确保数据质量,自动化构建框架由六位资深牙医进行校准,多选题与简答题的专家一致率达到99.98%,更复杂的病例题达到96.78%。对12个前沿LLM在GlobalDentBench上的评估显示,随着推理复杂度提高,性能出现急剧的阶梯式下降。具体而言,准确率从多选题的81.34%骤降至简答题的64.53%和病例题的22.34%,同时从L1的74.01%显著降至L2的55.64%和L3的35.71%。更关键的是,对真实牙科病例的风险分析表明,LLM生成的临床建议总体不安全率高达31.01%,其中4.51%存在对患者造成不可逆伤害的风险,且正畸等专科的风险尤为突出。这些发现暴露了当前LLM在医学推理与安全性方面的根本局限。因此,GlobalDentBench为可信临床AI评估提供了可扩展的基础,凸显了在这些模型安全部署于医疗之前进行严格验证的迫切需要。
