论文
ClinHallu:医学 MLLM 推理中诊断阶段性幻觉的基准
ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
摘要
构建值得信赖的医疗多模式 大语言模型 (MLLM) 对于可靠的临床决策支持至关重要。现有的医学幻觉基准主要侧重于数据收集,但往往忽略推理过程中幻觉的起源。我们发现不同样本的幻觉来源有所不同:错误可能源于视觉错误识别、不正确的医学知识回忆或有缺陷的推理整合。为了实现源级幻觉诊断,我们引入了 ClinHallu,这是医学 MLLM 推理中分阶段幻觉诊断的基准。 ClinHallu 包含 7,031 个经过验证的实例,其中每个实例都通过分解为视觉识别、知识回忆和推理集成的结构化推理跟踪进行了增强。我们还使用阶段替换干预措施来衡量纠正特定阶段如何影响最终答案。除了评估之外,我们还表明跟踪监督的 微调 减少了阶段性幻觉。 ClinHallu 提供了一个细粒度的幻觉测试平台,用于诊断和减轻医学 MLLM 中的推理失败。该基准可在 https://github.com/alibaba-damo-academy/ClinHallu 上公开获取。