论文
MedCausalX:自适应因果推理与自我反思,打造值得信赖的医学视觉语言模型
MedCausalX: Adaptive Causal Reasoning with Self-Reflection for Trustworthy Medical Vision-Language Models
摘要
视觉语言模型 (VLM) 通过将视觉感知与语言推理相结合,实现了可解释的医学诊断。然而,现有的医学思想链(CoT)模型缺乏明确的机制来表示和执行因果推理,这使得它们容易受到虚假相关性的影响,并限制了它们的临床可靠性。我们指出了医学 CoT 推理中的三个核心挑战:如何自适应地触发因果校正、构建高质量的因果虚假对比样本以及保持整个推理轨迹的因果一致性。为了应对这些挑战,我们提出了 MedCausalX,这是一个端到端框架,对医学 VLM 中的因果推理链进行显式建模。我们首先介绍 CRMed 数据集,它提供细粒度的解剖注释、结构化因果推理链和反事实变体,指导学习超越表面相关性的因果关系。 MedCausalX 基于 CRMed,采用两阶段自适应反射架构,配备 $\langle$causal$\rangle$ 和 $\langle$verify$\rangle$ token,使模型能够自主确定何时以及如何执行因果分析和验证。最后,通过错误归因强化学习优化的轨迹级因果校正目标细化了推理链,使模型能够区分真正的因果依赖性和捷径关联。针对多个基准的大量实验表明,MedCausalX 始终优于最先进的方法,将诊断一致性提高了 +5.4 分,将幻觉减少了 10 多分,并达到了最高的空间接地 IoU,从而为因果接地的医学推理树立了新标准。
