论文

扩展腹部 CT 的三维视觉基础模型

Scaling 3D Visual Grounding in Abdominal CT

模型训练合成数据

摘要

视觉定位模型可以通过将报告结果与图像区域联系起来来增强放射学工作流程。这对于 3D CT 来说尤其有价值,因为在 3D CT 中发现的结果通常只占体积的一小部分。 训练 3D 视觉定位模型需要大量配对短语和区域,构建此类数据集的成本很高,需要放射科医生手动注释图像。我们假设这种监督已经在常规报告期间隐式创建,因为放射科医生经常在关键图像上放置 2D 注释(例如距离测量、箭头)以进行测量并支持报告解释。我们引入了一个自动化管道,将这些常规临床注释转换为大规模短语区域监督,以实现 3D 视觉定位。该管道通过元数据匹配将每个注释与报告中的相应发现链接起来,然后使用可提示的 3D 分割模型将 2D 注释转换为体积掩模。这会产生短语-掩模-体积数据集,而不需要额外的放射科医生注释。我们的方法应用于单个机构的临床图片存档和通信系统 (PACS),从 59K 腹部 CT 检查中生成了 105K 个短语—掩码—体积三元组。我们还介绍了两个腹部 CT 视觉定位基准 LocusBench-Onc 和 LocusBench-ED,分别包含 240 个肿瘤科和 260 个急诊科放射科医生审查的短语-掩模-体积三元组,后者涵盖 13 个不同的类别,例如阑尾炎、血肿和疝气。我们进一步介绍了 LocusCT,这是一种在此数据集上训练的 3D 视觉定位模型,其在 LocusBench-Onc 上的命中率为 0.725,在 LocusBench-ED 上的命中率为 0.773,大大优于比较器模型。这些结果表明,常规 PACS 注释是一种可扩展的、以前未使用过的 3D 视觉定位监督来源。

扩展腹部 CT 的三维视觉基础模型的原论文方法或结果图
图 3:我们的方法为 3D CT 视觉定位提供大规模、与报告相关的监督。 (a) VoxTell 和 LocusCT 的训练数据的组成。如果其分割掩码与检查自己的临床报告中的影像发现短语配对,我们将其称为体积与报告关联。 VoxTell 的卷中只有 5%(其 CT 卷的 13%)与报告链接,而 LocusCT 训练集中的所有 65K 卷(来自 59K 检查)都是报告链接的。 (b) 105K 个发现结果在 20 个最常见类别中的分布,这些类别总共覆盖了所有发现结果的 88.1%。