论文

用于文本到图像生成中代表性多样性的多轴 Max@K 强化学习

Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation

模型训练强化学习

摘要

文本到图像 (T2I) 模型可以合成逼真的、与提示对齐的图像,但为同一提示生成的样本通常仅涵盖视觉上不同模式的一小部分。这限制了多样性,并且对于以人为中心的提示,可以反映或放大人口统计偏差。我们将这个问题形式化为目标模式覆盖,即一组预定义的语义指定模式的覆盖,并提出多轴 max@K,这是一种基于组的强化学习目标,用于在基于扩散的 T2I 模型中改进它。给定一组样本和每个目标模式一个分数,多轴 max@K 首先获取每个模式样本的最大分数,然后将这些每个模式的最大值相加。仅当提高某个模式的组最大值时,所得的信用分配才会对该模式给予样本正权重,因此不同的样本可以对不同的模式做出贡献。我们在合成混合物和具有确定性基于像素的颜色奖励的 SD3.5-M 上验证信用分配机制,然后将相同的目标应用于感知外观公平性。在保留提示下,多轴 max@K 在三个自动评估器下将公平性得分比基本模型提高了 0.23-0.36,同时保持图像质量和文本对齐。代码可在 https://github.com/KuOnoda/multi-axis-maxk 获取。