论文

DivRL:针对不同主题驱动生成的解开自相似性奖励

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

模型训练强化学习

摘要

主题驱动的图像生成面临着“身份多样性悖论”,其中强大的身份保留通常会导致僵化和低多样性的输出。我们提出了一个名为 DivRL 的 后训练 框架,该框架通过利用鲁棒相似性模型中分离的视觉特征,同时联合优化身份一致性和结构多样性。具体来说,我们引入负自相似性度量(nSSM)来量化结构多样性,并引入视觉语义匹配(VSM)来评估身份一致性。我们提出了一种“探索和抑制”策略,将 VSM 视为门控约束:模型自由探索结构上不同的配置,并且只有违反身份阈值的样本才会通过二次铰链损失进行惩罚。这将身份保留从竞争目标转变为可行性约束,从而允许 nSSM 和 VSM 共同改进。实验表明,我们的方法有效地推动模型生成一致和多样化的图像,并提高结构多样性,同时通过门控优化公式保持可比较的身份一致性。