论文

通过综合局部偏好生成解剖学上合理的人类图像

Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences

模型训练偏好优化

摘要

大规模文本到图像基础模型已经实现了显着的视觉真实感,但生成具有正确解剖结构的人体图像仍然具有挑战性。现有方法通过特定于部位的模块或在监督 微调 期间对高质量人类照片进行局部损失权重来强制执行解剖学约束,但此类数据集是有限的,并且由于照明、姿势和背景等混杂因素,通常会提供模糊的优化信号。基于偏好的对齐提供了一种替代方案,但标准直接偏好优化 (DPO) 平等对待所有像素,因此无法利用解剖伪影的局部性质。为了解决这个问题,我们提出了通过合成解剖偏好(ASAP)进行对齐的框架,该框架通过应用于高保真人类图像的局部退化机制构建受控偏好对。该机制通过在目标区域引入明确的解剖错误同时保留剩余内容来对图像进行受控实验。通过这种机制,我们创建了包含超过 10K 个精选对的人体解剖偏好 (HAP) 数据集,以实现文本到图像人类图像生成模型的有效解剖学对齐。为了更好地利用这些受控偏好对的局部性,我们引入了 DPO 的局部和边缘限制变体,它优先考虑目标解剖区域的优化,同时强制执行有限的偏好边缘以防止过度优化并保留全局语义。我们进一步介绍了 HAF-Bench,这是一个系统评估解剖保真度的基准。大量实验表明,ASAP 能够持续减少多个基础模型的解剖错误,同时保持整体图像质量。