论文

通过扩散修复进行乳房 X 线摄影分类的健康反事实生成

Healthy Counterfactual Generation via Diffusion Inpainting for Mammography Classification

模型训练应用与实践合成数据行业应用

摘要

由于检测和治疗的延迟,假阴性仍然是乳腺癌筛查计算机辅助诊断 (CAD) 系统的一个关键限制。为了解决这个问题,我们提出了一种反事实数据增强策略,通过从异常图像中“擦除”病变来生成健康的乳房X光照片,从而丰富训练分布。我们在 BI-RADS 1(健康)乳房 X 光照片上训练去噪扩散概率模型,并使用基于 RePaint 的采样策略在带注释的病变边界框中修复真实的正常组织。由此产生的健康反事实用真实的健康组织替换注释的病变区域,同时保留患者特定的解剖结构,如真实图像和生成图像之间的相似性度量所支持的那样。放射科医生进一步评估了图像真实感,发现其与原始数据集的质量一致。我们评估了四种代表性分类器架构的反事实增强:卷积神经网络(ConvNeXt)、视觉变换器(ViT)、预训练的视觉语言模型 乳房X光检查报告对(Mammo-CLIP)和基于多尺度注意力的多实例学习框架(FPN-MIL)。在 VinDr-Mammo 数据集上进行的实验表明,所有架构的灵敏度都有所提高,特别是在 80% 的固定特异性下,有助于实现更可靠的乳腺癌 CAD 系统。代码可在以下位置获取:https://github.com/ines03garcia/diffusion-based-counterfactual-generation.