论文
TextSLIP:用于生成医疗报告的文本自我监督 CLIP
TextSLIP: Text Self-Supervised CLIP for Medical Report Generation
摘要
自动生成放射学报告对于提高报告一致性和临床工作流程非常重要。虽然对比语言-图像预训练 (CLIP) 具有先进的医学视觉语言建模,但现有的 CLIP 式方法可能仍然无法为复杂的报告生成提供足够的细粒度语义监督。标准 CLIP 主要优化跨模态对齐,没有明确构建指导视觉表示学习的文本嵌入空间。为了解决这一限制,我们提出了 TextSLIP,这是一种通用医学视觉语言预训练框架,可以通过模内文本对比学习来增强 CLIP。通过自我监督的增强文本对来提高文本嵌入的辨别能力,TextSLIP 旨在为视觉编码器提供更细粒度的语言监督。作为初始验证,我们在包含 700 万个大脑 MRI 图像-文本对的精选数据集上对 TextSLIP 进行预训练,并在报告生成架构中微调预训练的视觉编码器。在与 CLIP 式基线的受控比较中,TextSLIP 在报告生成指标方面显示出一致的改进。消融研究进一步表明,文本端的自我监督有助于观察到的收益。这些结果表明,文本级对比学习是改善医学视觉文本对齐的一个有前途的方向,而跨其他医学领域的更广泛验证仍然是重要的下一步。