论文

反事实解剖学引导的时空解码,用于医学 VLM 中的无注释幻觉缓解

Counterfactual Anatomy-guided Spatial-Temporal Decoding for Annotation-Free Hallucination Mitigation in Medical VLMs

模型推理解码与生成控制

摘要

医学视觉语言模型(Med-VLM)在医学视觉问答方面表现出了强大的性能,但它们仍然容易产生幻觉,产生临床上不受支持的陈述,这些陈述缺乏足够的图像证据。解码过程中应用的缓解方法提供了一种实用的解决方案,但它们通常缺乏解剖意识或严重依赖 真值 注释,这限制了它们的适用性。我们提出了反事实解剖引导的时空解码(CAST),这是一个完全在推理过程中运行的框架,不需要手动注释来缓解基于解剖学的幻觉。 CAST 通过广泛的医学分割自动发现与给定查询相关的解剖区域。然后,它根据遮挡下答案可能性的下降,使用反事实干预来选择一个紧凑的、因果信息丰富的区域。在此选定区域的指导下,CAST 执行统一的对比解码过程,将无分类器指导与纠正空间注意力与逐步时间对比相结合以调节生成动态。在三个 Med-VLM 的 SLAKE 和 MIMIC-CXR 数据集上进行的实验表明,CAST 始终优于强大的基线,并超越依赖于 真值 的解码策略。我们的结果表明,紧凑的自动选择区域无需专家注释即可提供高效的对比指导,为改善空间基础和减少幻觉提供了实用且可推广的解决方案。代码可在 https://github.com/csyifan/CAST 获取。