论文

用于主题驱动的个性化文本到图像生成的阶段感知适应和分布校准

Stage-Aware Adaptation and Distribution Calibration for Subject-Driven Personalized Text-to-Image Generation

模型训练参数高效训练

摘要

主题驱动的个性化文本到图像生成需要预先训练的扩散模型,以从一些参考图像中获取特定主题,同时保留主题身份、遵循新颖的文本提示并保持样本多样性。现有的基于优化的方法通过完整的 微调、文本嵌入优化或低秩参数更新来实例化主题适应; PaRa从参数降维的角度进一步约束个性化。然而,统一的低秩约束或统一的适配器强度无法明确地区分不同去噪阶段的容量要求。此外,主要由身份相似性驱动的推理时候选者选择可能会压缩视觉表示空间中的所选样本。我们将问题分解为两个互补的部分:SPaRa 表示训练端阶段感知低秩自适应,DCAL 表示推理端分布校准候选选择,SPaRa-DCAL 表示组合框架。理论分析表明,时间步相关的缩放控制了低秩适配器的有效扰动幅度,而基于身份的候选选择在显式条件下限制了参考中心周围所选特征的半径。 SDXL 和 DreamBooth 30 受试者协议下的可审核实验表明,DCAL 在固定 LoRA 候选池上改进了 1-LPIPS、CLIP-I、DINO-I 和 CLIP-T,同时揭示了 CLIP/DINO 成对多样性和成对 LPIPS 的明显权衡。这些结果表明,个性化生成应该通过身份一致性、文本对齐和表示多样性来评估,而不仅仅是身份指标。