协同感知推理治理:用可验证的解剖证据为医学 MLLM 奠定基础
Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence
摘要
多模态 大语言模型 (MLLM) 在临床 VQA 和放射学报告生成方面显示出强大的前景,但推理时幻觉仍然破坏了可信使用:模型可以产生与成像证据相冲突的流畅结论。现有的缓解策略通常依赖于额外的训练、外部检索/知识库或多阶段事后验证,这增加了成本和管道的复杂性,并且通常在模型和任务之间的泛化性很差。为了解决这个问题,我们提出了一个整体的 无需训练 证据注入框架,通过双边证据注入系统地缓解幻觉。通过在我们的实施中利用 MedSAM 获得的 ROI 先验,我们通过 ROI 引导的激活调制重新校准视觉感知轨迹,同时通过将解剖坐标映射到离散语义标记作为可验证的外部记忆来锚定文本推理轨迹。然后,我们引入一个任务感知动态路由器,根据任务语义选择特定模态的干预措施,平衡感知证据依赖和语言流畅性。我们使用 \texttt{LLaVA-1.5-7B}、\texttt{LLaVA-Med-1.5-7B}、\texttt{Qwen3-VL-8B/32B} 和 \texttt{InternVL-3.5-8B/38B} 对 2 个任务和 5 个数据集进行系统评估。受控消融和可视化进一步验证了该框架,该框架在整个医学基准测试中始终优于基线,将封闭式准确性提高了 $\sim\mathbf{6}\%\uparrow$,并将开放式幻觉减少了 $\sim\mathbf{35}\%\downarrow$。该代码已在 GitHub 上提供:\href{https://github.com/Henry991115/SPRG}{\textcolor{blue}{https://github.com/Henry991115/SPRG}}。