论文
Med-StepBench:用于评估医学视觉语言模型中的幻觉的分层推理框架
Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models
摘要
大型视觉语言模型 (VLM) 在医学图像理解方面表现出强大的性能,但经常生成临床上合理但不正确的陈述,从而引发严重的安全问题。现有的医学幻觉基准主要侧重于带有一次性诊断问题的二维成像,对预测是否基于正确的定位和异常识别提供了有限的洞察,从而使关键的推理错误仍然隐藏在看似正确的诊断背后。我们推出了 Med-StepBench,这是第一个用于 3D 肿瘤 PET/CT 中逐步幻觉检测的大规模基准,包含超过 12,000 张图像和超过 1,000,000 个跨体积和多视图 2D 数据的图像语句对,它将临床推理分解为四个专家设计的诊断阶段。使用经临床医生验证的注释,我们对通用和医疗 VLM 进行第一步级评估,揭示被聚合准确性指标掩盖的系统故障模式。此外,我们表明,当前的 VLM 非常容易受到对抗性但临床上合理的中间解释的影响,尽管视觉证据相互矛盾,但这些解释会显着放大幻觉。总之,我们的研究结果强调了多步骤临床推理的基本局限性,并将 Med-StepBench 确立为开发更安全、更可靠的医学 VLM 的严格基准。