从推理到像素:用于 VQA 和分割的视觉证据定位医疗多模态 LLM
From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation
摘要
尽管多模态 大语言模型 (MLLM) 在医学视觉问答 (Med-VQA) 中表现出了令人印象深刻的性能,但它们对全局图像特征的依赖往往缺乏精确的像素级基础,从而限制了临床可信度。为了弥合高级临床推理和空间定位之间的语义差距,我们提出了 \textsc{\textsc{MedREAL}} (\textbf{Med}ical \textbf{RE}asoning-driven \textbf{A}nswering 和 \textbf{L}ocalization),这是一个将语言推理与空间基础无缝结合的统一框架。具体来说,\textsc{MedREAL} 引入了 \textbf{S}eg \textbf{A}nchored \textbf{R}easoning \textbf{P}ooling (SARP),以直接从 MLLM 隐藏状态中的 \texttt{[SEG]} 标记中提取与任务相关的语义证据。此外,提出了一种\textbf{R}easoning-\textbf{V}isual(R2V)融合机制,以有效地将这些推理感知特征注入到分割管道中,以实现准确的掩模解码。为了促进这一范例,我们构建了 MedRAVS-13K,这是一个综合数据集,包含四种不同成像模式的 13,824 个经过专业验证的样本。大量实验表明 \textsc{MedREAL} 显着优于最先进的技术,在基准评估中达到 68.49\% gIoU 和 70.47\% cIoU。通过生成与文本诊断严格一致的证据掩模,\textsc{MedREAL} 为推理驱动的医学图像分析提供了一个强大的、可解释的框架。