论文
AgenTeeth:一种与模型无关的框架,用于通过工具证据注入抑制牙科 X 射线冻结视觉语言模型中的幻觉
AgenTeeth: A Model-Agnostic Framework for Suppressing Hallucination in Frozen Vision-Language Models on Dental X-Rays via Tool Evidence Injection
摘要
视觉语言模型(VLM)在全景牙科射线照片上仍然很大程度上不可靠,并且可以依赖于学习的解剖先验而不是图像中的证据。这对于牙齿定位和空间推理来说尤其成问题,而微调的牙科 VLM 可以保留相同的空间偏差。我们推出了 AgenTeeth,这是一个与模型无关的工具增强框架,使用七位专业牙科视觉专家来构建冻结的 VLM。具有问题意识的编排器会选择相关工具,其检测结果会映射到 FDI 牙齿编号或解剖区域,并作为结构化结果与带注释的图像叠加一起返回。然后,新的综合调用会使用此证据回答问题,而无需微调底层 VLM。在 MMOral-OPG-Bench 上,AgenTeeth 将四个骨干 VLM 比其基线提高了 12.9-23.0 个百分点。我们最强的配置在开放式 VQA 上达到 65.66%,而 OralGPT-Plus 为 45.35%。该优势在匹配的规模上也保持不变:带有 AgenTeeth 的冻结 Qwen2.5-VL-7B-Instruct 达到 48.11%,超过了在工具使用的监督微调和强化学习后在同一主干上构建的 OralGPT-Plus。我们发布了该框架、所有七个专家模型以及牙医注释的数据集,用于全景射线照片中的牙槽骨丢失检测。