论文
通过增强的视觉语言对齐实现临床忠实的医学图像字幕
Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment
摘要
医学图像字幕是一种加速早期诊断工作流程并增强医疗诊断人工智能系统可解释性的技术。然而,与一般图像字幕不同,由于基于灰度的模式、微妙的解剖线索、专门的医学措辞和数据质量的变化,临床上可靠的字幕仍然具有挑战性。尽管大型视觉语言模型最近取得了进展,但流畅的输出不一定能保证与临床概念空间或评估标准充分一致。为了解决这个问题,我们提出了一个框架,通过分离和增强训练时间对齐和推理时间对齐来加强临床对齐。我们构建了一个医学图像字幕管道,集成了基于 BioMedCLIP 和 SigLIP2 的单/双视觉编码器、Q-Former 和基于 LLaMA 的解码器,并检查了辅助学习对 UMLS 概念/类型预测的贡献。在推理时,我们应用基于单嵌入的重新排序来选择候选者中的最佳标题,而在训练时,我们引入 MedPAIR-SCST,它结合了临床相关奖励,将生成分布转向改善临床一致性。我们的实验表明,具有多编码器设计和概念级辅助学习的互补视觉表示有助于保留有临床意义的信息。此外,推理时间重新排序提供了一种无需额外训练即可改善语义和临床一致性的实用方法,而 MedPAIR-SCST 超越了选择,直接改进了模型的分布,以生成更加一致和基于临床的描述。这些发现表明,联合利用基于选择的对齐和基于强化学习的对齐可以促进更值得信赖的医学图像字幕,即使在数据受限的环境中也是如此。