论文

实现真实世界的超声理解:来自多图像检查和长格式报告的大型视觉语言模型

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

模型训练监督微调与指令调优

摘要

大型视觉语言模型 (LVLM) 在许多医学成像任务中取得了强大的性能,但由于其固有的复杂性和可变性,它们在超声中的应用仍然受到限制。在这项工作中,我们重新审视了实现现实世界超声理解的真正需要。我们没有引入复杂的架构或复杂的训练策略,而是证明数据规模和临床忠实的数据对齐是关键因素。我们构建了 150 万个真实世界超声检查的大型数据集,其中包含 1770 万张图像、多器官覆盖以及配对的未经整理的临床报告。至关重要的是,我们在检查级别组织数据,将多个图像与其相应的报告对齐,以反映真实的临床工作流程。然后,我们使用低秩适应 (LoRA) 在此数据集上微调标准 LVLM,无需针对特定任务进行修改。令人惊讶的是,这个简单的方法已经在不同的超声理解任务中产生了强大的性能,优于使用更复杂的管道设计的先前方法。除了这些结果之外,我们还提出了模型和数据标度分析,为超声 LVLM 中标度的作用提供了见解。