论文

用于情境消除偏差的个性化生成模型

Personalized Generative Models for Contextual Debiasing

模型训练合成数据

摘要

不同的视觉模式在世界上出现的频率不同:例如,沙滩球出现在沙滩上的频率比出现在道路上的频率高。这些统计数据反映在视觉数据集中,因此经过训练的模型更容易识别常见场景中的物体。然而,识别道路上的沙滩球可能比识别沙滩上的沙滩球更重要。我们研究如何减轻这种差异。由于在现实世界中收集不常见的图像可能很困难,因此我们探索生成频率较低的图像是否可以作为有效的训练增强。一个关键的挑战是引导几代人保持接近原始数据集分布,同时创建具有不常见上下文的多样化图像。我们引入了 Decoupling Contextual Patterns with Generations (De CoupleGen),这是一种个性化文本到图像扩散模型的方法,以促进具有稀有上下文的图像的连贯合成,同时保留原始视觉细节。生成的图像包含语义上有意义的内容,并在视觉上与原始数据集保持一致。我们进一步应用验证约束来确保增强数据的相关性。我们评估了复杂场景数据集上的对象分类和识别任务的方法。我们的实验证明了对以前方法的持续改进,并且我们的分析确定了这些改进背后的因素。