论文

放射学空间定位 2D 视觉语言模型的可扩展训练

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

模型训练合成数据

摘要

我们研究如何训练放射学中基于视觉的视觉语言模型(VLM),而无需手动空间注释。我们引入了 RefRad2D,这是一个源自临床实践的 1.2M CT 和 MR 图像文本对的大型双语(德语/英语)数据集,具有通过基于 LLM 的管理和自动分割自动生成的特定任务 VQA 和空间定位子集。根据这些数据进行训练,我们的模型 RadGrounder 通过边界框检测或分割联合执行报告生成、视觉问答和空间定位。在外部 VQA 基准(Slake、VQA-RAD)上,RadGrounder 通过专业医疗 VLM 取得了具有竞争力的结果。将我们的临床数据添加到训练混合物中,与仅在下游数据集上的 微调 相比,改进了开放式 VQA,显示了我们数据集的可转移性。至关重要的是,增加基础监督不会降低语言质量,从而在不影响 VQA 性能的情况下实现空间可验证的输出。