论文
OralMLLM-Bench:评估牙科实践中多模式 大语言模型 的认知能力
OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice
摘要
多模态 大语言模型 (MLLM) 已成为牙科图像分析的一个有前途的范例。然而,他们捕获放射线照相分析所需的多层次认知过程的能力仍不清楚。在这里,我们提出了一个全面的基准来评估 MLLM 在牙科射线照相分析中的认知能力。它涵盖三种关键的成像模式,即根尖周、全景和侧位头影测量X光片,并定义了四个认知类别:感知、理解、预测和决策。该基准包括源自公共数据集的 27 项临床基础任务,以及手动注释和 3,820 项临床医生评估。评估了六种前沿 MLLM,包括 GPT-5.2 和 GLM-4.6。我们展示了 MLLM 和临床医生在牙科实践中的绩效差距,描述模型的优势和局限性,描述失败模式,并提供改进建议。该数据资源将促进与牙科实践中的临床认知、安全要求和工作流程复杂性相一致的下一代人工智能系统的开发。