论文

Pocket-Dentist:通过高效多模态实现设备上牙科图像理解 大语言模型

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

模型评测基准与评测资源

摘要

牙科视觉语言模型的评估在数据集、任务定义和指标方面仍然分散,并且经常忽略其计算成本。这限制了它们在专业中心之外广泛部署牙科筛查,在这些中心,及时的推理、有限的硬件和患者图像的本地处理对于实用、保护隐私的临床预筛查至关重要。在这里,我们推出 Pocket-Dentist,这是一种牙科多模式问答的效率感知基准,汇集了来自 BRAR 和 MetaDent 的三个数据集,涵盖约 1,159 名患者、五种任务类型和七个指标。在 14 个典型的 VLM 中,我们的结果揭示了一个有趣的观察结果:紧凑型 VLM(例如 2B 参数模型)在轻量级自适应之后,在大多数指标上都可以与更大的 VLM 竞争,同时在牙科图像理解方面需要显着降低的计算成本。我们经过微调的紧凑型 VLM Pocket-Dentist-2B 在 iPhone 17 Pro 本地部署,在 4.31 秒内处理每个样本,与 7B 基准相比,延迟减少了 4.9 倍,内存使用量减少了 2.3 倍。我们的项目页面位于 https://2026-icml.github.io/pocket-dentist-icml。