论文

MetaDent:为牙科视觉语言模型标记临床图像

MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 在医学图像分析中表现出了巨大的潜力,但由于缺乏细粒度、带注释的数据集和综合基准,它们在口内摄影中的应用在很大程度上仍未得到充分探索。为了解决这个问题,我们推出了 MetaDent,这是一种综合资源,其中包括 (1) 从临床、公共和网络资源收集的新颖且大规模的牙科图像数据集; (2) 半结构化注释框架,旨在捕捉牙科摄影的层次结构和临床细微差别; (3) 用于评估临床图像理解方面最先进的 VLM 的综合基准套件。我们的标签方法将高级图像摘要与异常情况的逐点自由文本描述相结合。这种方法可以实现丰富、可扩展且与任务无关的表示。我们整理了来自不同来源的 60,669 张牙科图像,并使用这种元标记方案对 2,588 张图像的代表性子集进行了注释。利用 大语言模型 (LLM),我们得出标准化基准:大约 15K 视觉问答 (VQA) 对和 18 类多标签分类数据集,我们通过人工审查和错误分析对其进行验证,以证明 LLM 驱动的转换可靠地保留了保真度和语义准确性。然后,我们评估 VQA、分类和图像字幕任务中最先进的 VLM。定量结果表明,即使是最先进的模型也难以对口腔内场景进行细粒度的理解,达到中等精度并在图像字幕中产生不一致或不完整的描述。我们公开发布我们的数据集、注释和工具,以促进可重复的研究并加速牙科应用视觉语言系统的开发。