论文
VITAL:视觉语义双重监督,用于医学 MLLM 中增强和可解释的潜在推理
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
摘要
潜在推理能够对连续隐藏状态而不是显式标记进行推理,从而避免了医学 VQA 思想链的语言瓶颈和推理开销。然而,现有方法存在模态崩溃、视觉监督不足和训练推理不匹配等问题。此外,它们不透明的潜在状态不提供可解释性,这在临床应用中至关重要。我们提出了 VITAL,一种具有视觉语义双重监督的医学 MLLM 的潜在空间推理框架:辅助文本解码器从潜在状态重建推理链,而视觉投影仪则从冻结的独立医学视觉编码器回归 ROI 特征。这两个模块都在推理时以零开销被丢弃,但可以事后重新附加以实现双重可解释性,在不牺牲效率的情况下提供推理过程的文本和视觉解释。我们构建了一个涵盖 9 种成像模式的 61K 数据集,超出了先前的医学视觉潜在推理数据集一个数量级。 7 个基准的实验表明,VITAL 的性能始终显着优于主干网络、所有潜在推理基线以及在更大数据上训练的医学 MLLM,实现了与万亿参数专有模型相媲美的最先进结果。