论文

基础模型启用的高效数据采样 (FEEDS):针对泛癌、多示踪剂 PET/CT 数据集的标签高效训练策略

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

模型训练合成数据

摘要

全身 PET/CT 成像中的自动病灶分割可以帮助临床医生跨放射性示踪剂和癌症类型进行癌症检测、分期和治疗计划。然而,训练捕获病变大小、分布和外观变化的病变分割模型需要大量带注释的数据集,而其创建既耗时又需要专业知识。因此,基于有限标记 PET/CT 数据训练的模型通常缺乏临床使用所需的准确性和普遍性。我们提出了 FEEDS(基础模型启用的高效数据采样),这是一种标签和计算高效的学习策略,它使用视觉基础模型嵌入来选择信息最丰富且多样化的未标记案例进行专家注释。与无监督、半监督和主动学习方法不同,FEEDS 是一种一步训练范例,仅需要有限的、有代表性的训练集,使其具有标签和计算效率。我们使用 AutoPET-III 数据集训练和验证 FEEDS。我们在三个保留的数据集上测试其准确性和普遍性:AutoPET-III、DeepPSMA 和达特茅斯-希区柯克医疗中心内部数据集。我们评估体素、病变和解剖区域水平的临床效用,以评估高风险区域的表现和治疗计划的效用。 FEEDS 的性能优于基于随机采样的标记、基于伪标记的半监督学习以及仅使用有限标记数据进行的训练。它概括了所有三个测试集、FDG 和 PSMA 示踪剂以及多种疾病,匹配完全标记 (100\%) 的训练性能,同时注释负担减少了 70\%。 FEEDS 通过提供一种实用方法来从大型、未注释的临床存储库构建代表性和多样化的注释队列,解决了自动病变分割框架中标签稀缺的挑战。