论文
DinoDental:将 DINOv3 作为牙科图像分析的统一视觉编码器进行基准测试
DinoDental: Benchmarking DINOv3 as a Unified Vision Encoder for Dental Image Analysis
摘要
牙科影像专家注释的稀缺性和高昂成本给牙科人工智能的发展带来了重大挑战。 DINOv3 是一种最先进的自我监督视觉基础模型,已在 17 亿张图像上进行了预训练,为缓解这一问题提供了一条有希望的途径。然而,当其独特的成像特征和临床微妙性转移到牙科领域时,其可靠性仍不清楚。为了解决这个问题,我们推出了 DinoDental,这是一个统一的基准测试,旨在系统地评估 DINOv3 是否可以作为可靠的现成编码器进行全面的牙科图像分析,而无需特定领域的 预训练。 DinoDental 由多个公共数据集构建而成,涵盖广泛的任务,包括全景射线照片和口腔内照片的分类、检测和实例分割。我们通过缩放模型的大小和输入分辨率,并比较不同的适应策略(包括冻结特征、完整的 微调 和参数高效的低秩适应(LoRA)方法)进一步分析模型的传输性能。我们的实验表明,DINOv3 可以作为跨全景射线照片和口腔内照片的牙科图像分析的强大统一编码器,在跨任务中保持竞争力,同时在口腔内图像理解和边界敏感密集预测方面显示出特别明显的优势。总的来说,DinoDental 提供了一个系统框架,用于全面评估牙科分析中的 DINOv3,建立基础基准来指导牙科 AI 社区高效、有效的模型选择和适应。