论文

GlobalDentBench:经专家校准、评估LLM牙科临床推理的多国基准

GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration

模型评测基准与评测资源

摘要

尽管大语言模型(LLM)具有变革医学的潜力,但其在真实临床场景中的推理稳健性与安全性仍严重缺乏研究,牙科领域尤甚。本文介绍GlobalDentBench,首个多国牙科基准,其分类体系涵盖六大洲88个国家和地区的14个牙科专科。该基准包含8,978道经专家验证的题目,覆盖三种形式(多选题、简答题和基于病例的题目),并评估三个递进的推理层级:知识回忆(L1)、常规推理(L2)和个性化推理(L3)。为确保数据质量,自动化构建框架由六位资深牙医进行校准,多选题与简答题的专家一致率达到99.98%,更复杂的病例题达到96.78%。对12个前沿LLM在GlobalDentBench上的评估显示,随着推理复杂度提高,性能出现急剧的阶梯式下降。具体而言,准确率从多选题的81.34%骤降至简答题的64.53%和病例题的22.34%,同时从L1的74.01%显著降至L2的55.64%和L3的35.71%。更关键的是,对真实牙科病例的风险分析表明,LLM生成的临床建议总体不安全率高达31.01%,其中4.51%存在对患者造成不可逆伤害的风险,且正畸等专科的风险尤为突出。这些发现暴露了当前LLM在医学推理与安全性方面的根本局限。因此,GlobalDentBench为可信临床AI评估提供了可扩展的基础,凸显了在这些模型安全部署于医疗之前进行严格验证的迫切需要。

GlobalDentBench:经专家校准、评估LLM牙科临床推理的多国基准:论文配图
图 1:GlobalDentBench 概述。答:该基准是根据从 88 个来源国家或地区收集的材料建立的。 B. 所有项目均分为三个推理级别:L1(知识回忆)、L2(常规推理)和 L3(个性化推理)。 C. 该基准涵盖 14 个牙科学科。 D. GlobalDentBench 包含三种问题类型,包括多项选择题 (MCQ)、简答题 (SAQ) 和基于案例的问题 (CBQ),并为每种类型提供了示例。