论文
通过同质-异质分割对合成图像进行后生成管理
Post-Generation Curation of Synthetic Images via Homogeneous-Heterogeneous Splitting
摘要
最近的生成模型可以生成高质量的合成图像,为数据匮乏的模型提供可扩展的训练数据。开发这种潜力的现有方法通常涉及 1) 训练或 微调 生成器,或 2) 使用轻量级事后适应,例如即时工程或推理时间指导,使它们特定于生成器且专业知识密集。我们研究一个补充问题:给定固定的生成图像池,是否可以纯粹通过选择信息丰富的子集来提高下游效用?答案是肯定的。我们表明,有效的选择必须对抗现代生成器的结构偏差:它们往往会过度产生每个类别的规范模式,而低估了类别内的变异。基于这一见解,我们将每个真实类别分为规范同质(HO)子集和非冗余异构(HE)子集,然后通过保真度多样性标准对合成图像进行评分,该标准奖励语义对齐,同时惩罚规范冗余。该方法与生成器无关,不需要重新训练。在多个基准测试中,它始终优于最先进的数据选择基准,并与实际数据性能相匹配,而合成样本数量减少了 40%。当应用于更强的任务调整生成器时,相同的标准仍然有效,并且在分类和分割任务上都有收益。因此,生成后选择并不是更好生成器的替代品,而是提高合成数据效用的补充机制。