论文
用于下游视觉任务的具有扩散模型的少样本合成数据生成
Few-Shot Synthetic Data Generation with Diffusion Models for Downstream Vision Tasks
摘要
类不平衡是视觉识别中的一个持续挑战,特别是在安全关键领域,收集正面例子的成本很高,而且罕见事件本质上代表性不足。我们提出了一种轻量级合成数据增强管道,可以在少至 20-50 个稀有类别的真实图像上微调 LoRA 适配器,并使用预训练的扩散模型来生成用于训练的合成样本。我们系统地改变合成与真实的比率,并评估两个结构不同领域的方法:胸部 X 射线病理学分类 (NIH ChestX-ray14) 和工业表面裂纹检测(磁砖缺陷数据集)。所有评估均仅在保留的真实图像集上进行。在这两个领域中,与单独使用真实数据进行训练相比,合成增强持续提高了稀有类召回率和 F1。适度的合成增强会提高性能,但随着合成比例的增加,性能会逐渐递减。这些结果表明,LoRA 适应的扩散模型提供了一种简单且可扩展的机制来增强稀有类别,从而能够在异构视觉域的数据稀缺场景中进行有效学习。