论文

Poplar:用于以人为中心的图像数据集合成的可扩展管道

Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis

模型训练合成数据

摘要

最近的图像生成器可以合成令人信服的以人为中心的图像,但生成有用的集合仍然不同于生成单个成功的图像。以人为中心的数据集必须涵盖不同的人和环境,避免难以置信的属性组合,保留日常摄影特征,并大规模公开质量控制决策。我们提出了 Poplar,一个可重复的指定-渲染-检查管道,用于以人为中心的图像数据集合成。在常识约束下指定样本的结构化属性,并将它们表述为面向摄影的提示。渲染使用跨构图感知纵横比的现实主义适应图像生成器,并重试明显的技术故障。 Inspect 对每位候选人应用单一的结构化视觉语言审查,保留原始提示,同时拒绝内在图像缺陷或材料提示不匹配。使用 Poplar,我们构建了 Poplar-9K:从 11,765 个经过审查的候选者中保留了 9,401 个精心策划的以人为中心的图像-文本对(79.9% 接受度)。我们将数据集与管道、配置、不可变的生成提示和可审核的检查记录一起发布,作为构建可定制的以人为中心的集合的紧凑资源。