论文
Med-OPD:通过证据感知改善医学视觉语言模型 同策略 蒸馏
Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation
摘要
医学视觉语言模型(Med-VLM)需要从细粒度的视觉证据中进行可靠的推理,但现有模型可以通过依赖语言先验或医学模板来产生可信的临床答案,而不是真正关注诊断关键区域。 同策略 蒸馏 (OPD) 对学生生成的轨迹提供密集的 词元级 监督,并提供隐私兼容的能力传输方式,无需重新分配原始患者数据。然而,标准 OPD 统一提取所有标记,导致稀疏的证据依赖标记被丰富的临床叙述标记稀释。受到 OPD 在 大语言模型 社区中成功的启发,我们提出 \textbf{Med-OPD},据我们所知,这是第一个统一的 后训练 框架,它将 同策略 蒸馏 与 Med-VLM 的医学证据感知监督相集成。我们引入了\textbf{医学证据优势}(MEA),这是一种以教师为基础的反事实信号,它使用答案感知提示将教师评分集中在支持目标诊断的证据上,并通过比较原始成像模式和证据退化成像模式下的教师可能性来测量每个标记对医学视觉证据的依赖性。基于 MEA,Med-OPD 在词元和轨迹级别重新分配 蒸馏 信号,强调诊断关键词元和依赖证据的生成轨迹。对 OmniMedVQA 子集的实验表明,Med-OPD 在 CT、MRI、疾病诊断和病变分级方面始终优于 SFT 和标准 OPD。这些结果表明,证据感知的 蒸馏 可以更好地加强医学 VLM 对关键视觉证据的依赖,并提高可靠的多模态医学推理。源代码和数据公开于:https://github.com/yunhang8658/MedOPD.git