论文
从图像解释到临床推理:上游医生上下文感知多模态学习与因果强化学习
From Image Interpretation to Clinical Reasoning: Upstream Physician-Context-Aware Multimodal Learning with Causal Reinforcement Learning
摘要
主要不良心血管事件(MACE)仍然是全球死亡的主要原因。使用常规获取的临床数据进行机会性筛查提供了一种可扩展的方法,可以在急性事件发生之前识别高风险个体。尽管胸部 X 射线 (CXR) 捕获潜在的心血管生物标志物,并且临床病史提供了补充的患者背景,但现有的医学视觉语言模型主要针对放射学解释而不是预后推理进行优化。我们提出了一种用于多模态临床推理的因果强化学习框架,该框架整合了 CXR 和医生撰写的临床历史,以进行机会性 MACE 预测。该框架引入了(1)角色解耦的双大语言模型架构,将推理与风险预测分开,(2)用于证据选择和推理优化的双动作因果强化学习策略,以及(3)因果标记修剪以学习紧凑的多模态表示。在内部队列、急诊科队列和外部 MIMIC 数据集上进行评估,所提出的框架始终优于单峰基线和最先进的医学视觉语言模型,分别实现了 0.720、0.760 和 0.845 的 AUROC。它还显着提高了推理质量,实现了更高的 GREEN 分数和更高的专家偏好,同时在不同患者群体中保持了稳健的预测性能。