论文
MedLVR:可靠的医学视觉问答的潜在视觉推理
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
摘要
医学视觉语言模型(VLM)在医学视觉问答(VQA)方面显示出强大的潜力,但它们的推理仍然主要以文本为中心:图像被编码为静态上下文,随后的推理由语言主导。这种范式从根本上限制了临床场景,其中准确的答案通常依赖于微妙的、局部的视觉证据,而这些证据无法在静态嵌入中可靠地保存。我们提出了 \textsc{MedLVR},一个潜在的视觉推理框架,它将显式的视觉证据状态引入自回归解码中。 \textsc{MedLVR} 不是仅仅依赖于基于文本的中间推理,而是通过重用隐藏状态作为连续的潜在步骤,在解码器内交错一个短的潜在推理段,从而在生成答案之前能够迭代保存和细化与查询相关的视觉证据。为了支持有效的视觉监督,我们采用两阶段训练策略:感兴趣区域(ROI)监督的微调将潜在状态与临床相关图像证据对齐,视觉潜在策略优化(VLPO)进一步优化结果级奖励下的潜在推理和答案生成。 OmniMedVQA 和五个外部医学 VQA 基准测试表明 \textsc{MedLVR} 始终优于最近的推理基线,并将 Qwen2.5-VL-7B 主干网的平均得分从 48.3% 提高到 53.4%。这些结果表明,潜在视觉推理为保存诊断相关视觉证据和提高医学 VQA 的可靠性提供了有效的机制。