论文
UR$^{2}$-MLLM:用于生成放射学报告的多模态 大语言模型 中的不确定性感知重访推理
UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation
摘要
放射科医生通过迭代和选择性地重新访问可疑区域来生成诊断报告,以完善他们的解释。最近用于放射学报告生成(RRG)的多模态 大语言模型(MLLM)已经从纯文本推理转向“图像思考”范式,将视觉证据纳入推理过程。然而,现有方法提供静态视觉证据,而在推理过程中没有动态重访机制,忽略了放射科医生如何重新检查不确定的观察结果。为此,我们提出了一种不确定性感知重访推理 MLLM (UR$^{2}$-MLLM) 框架,该框架在 RRG 推理过程中动态重访不确定区域。 UR$^{2}$-MLLM 首先通过在不确定性感知数据集上进行训练来配备不确定性感知。然后,我们构建一个多模态推理轨迹数据集以及检测和复制机制,指导何时何地重新访问。最后,视觉基础奖励通过强化学习来完善这种行为,将重新访问的区域与相应的解剖结构对齐。 MIMIC-CXR 和 IU-Xray 上的实验表明 UR$^{2}$-MLLM 实现了最先进的性能,凸显了不确定性感知视觉重访推理对于可靠且临床一致的报告生成的价值。