论文
PortraitGen:范例驱动的 GRPO,具有双重奖励指导,可生成逼真的肖像
PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation
摘要
组相对策略优化 (GRPO) 等强化学习显着改进了文本到图像 后训练。然而,当前的方法往往偏向于肤浅的美学,例如过度饱和的颜色,而导致人工智能伪影和生物不可信等关键缺陷未能得到解决。我们将这些限制归因于两个主要因素:(1)后训练 期间缺乏真实图像将 GRPO 采样限制在原始分布中,未能打破固有的生成边界; (2) 优化过程缺乏针对细粒度伪影(例如过度油性皮肤和其他人工智能伪影)的特定奖励。为了解决这个问题,我们提出了 PortraitGen,这是一种专为生成逼真肖像而量身定制的新颖框架。首先,我们通过直接将真实图像引入 GRPO 采样组来打破固有的生成边界,其中采用图像反演来获得它们的转移概率和潜伏。其次,为了明确引导模型走向真实感,我们引入了一种互补的双重奖励机制:用于一般质量的 OmniReward 和用于以人为中心的保真度的 AI-Portrait。此外,我们还策划了 PortraitBench,这是一个以肖像为中心的综合基准测试。大量实验表明,PortraitGen 的性能显着优于现有基线,有效抑制了 AI 伪影并实现了前所未有的照片级真实感。