论文

帕累托增强肖像生成:视觉对齐文本监督以实现对齐、现实主义和美学

Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics

模型训练监督微调与指令调优

摘要

文本到图像的扩散模型在人类肖像生成中经常面临严重的三难困境:文本图像对齐、照片写实主义和人类感知的美学本质上相互抑制。有监督的 微调 (SFT) 是增强图像生成真实感的有效方法。然而,它通常会导致对训练数据集的过度拟合,破坏预先训练的图像先验,并降低对齐或美观性。为了打破这个瓶颈,我们提出了一种多模态扩散 Transformer (MM-DiT) 的特征监督范例。具体来说,我们引入了一种轻量级跨模式对齐机制,该机制隐式地从 SigLIP 2 中提取多粒度视觉对齐文本表示,并在训练阶段对 MM-DiT 的图像分支应用监督,且额外推理开销为零。我们的方法注入视觉对齐的文本指导,同时保留基本模型的原始泛化,避免 SFT 造成的退化。此外,我们的方法直接从预先训练的视觉基础模型中挖掘隐含的多粒度美学信号,以优化人类感知的美学。对 MM-DiT 的大量实验表明,我们的方法推动了帕累托前沿,并在文本图像对齐、照片写实主义和人类感知美学方面实现了协同改进。