胃肠内窥镜 VLM 中幻觉检测的基准
A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy
摘要
视觉语言模型(VLM)容易产生幻觉,这仍然是其在临床实践中安全部署的主要障碍。迄今为止,大多数幻觉检测方法已在 MIMIC-CXR 和 VQA-RAD 等放射学基准上进行了评估,而胃肠 (GI) 内窥镜检查在很大程度上仍未得到充分探索。在本文中,我们在 Gut-VLM 数据集上对九种幻觉检测方法进行了基准测试,Gut-VLM 是一个胃肠道诊断视觉问答 (VQA) 数据集,包含 4,392 个测试 VQA 对,涉及五个 VLM(MedGemma-4B、MedGemma-27B、LLaVA-Med-7B、LLaVA-v1.6-7B 和 Lingshu-32B)。这些方法涵盖三类:黑盒方法(RadFlag、SelfCheckGPT-NLI)、灰盒方法(AvgProb、AvgEnt、MaxProb、MaxEnt、语义熵和 VASE)和白盒方法(ReXTrust)。我们的结果表明,ReXTrust(一种白盒方法)在所有五个模型中实现了最高的 AUC,在每个 VLM 上的表现都优于最强的替代方法(配对排列测试,在所有情况下 p < 0.001),在 MedGemma-4B 上达到了 93.0 的峰值 AUC。白盒隐藏状态访问提供了平均 19.5 AUC 点(范围:9.5--33.5)的一致优势,即使在 LLaVA-v1.6-7B (AUC 79.9) 上,ReXTrust 也能保持强劲的性能,其中黑盒方法和基于集群的灰盒方法崩溃到接近机会的性能。在非白盒方法中,词元级 灰盒统计(MaxEnt、MaxProb)是最强的替代方案,平均优于基于聚类的灰盒方法(语义熵、VASE)和黑盒方法。我们进一步将置信混淆(confidence confabation)识别为一种失败模式,其中模型以高样本间一致性或高 词元级 概率产生幻觉,作为基于一致性和不确定性的方法的系统性失败。