论文

根据个人喜好个性化文本到图像的生成

Personalizing Text-to-Image Generation to Individual Taste

模型训练奖励建模与过程监督

摘要

现代文本到图像 (T2I) 模型可生成高保真视觉效果,但对个人用户偏好仍然漠不关心。虽然现有的奖励模型针对“平均”人类吸引力进行了优化,但它们未能捕捉到审美判断的固有主观性。在这项工作中,我们引入了一种新颖的数据集和预测框架,称为 PAMELA,旨在对个性化图像评估进行建模。我们的数据集包含由最先进的模型(Flux 2 和 Nano Banana)生成的 5,000 张不同图像的 70,000 个评分。每张图像均由 15 位不同的用户进行评估,提供了跨艺术、设计、时尚和电影摄影等领域的丰富的主观偏好分布。利用这些数据,我们提出了一种个性化奖励模型,该模型在我们的高质量注释和现有的美学评估子集上联合训练。我们证明,我们的模型预测个人喜好的准确度比当前大多数最先进的方法预测人口水平偏好的准确度更高。使用我们的个性化预测器,我们演示了如何使用简单的提示优化方法来引导几代人转向个人用户偏好。我们的结果强调了数据质量和个性化对于处理用户偏好的主观性的重要性。我们发布数据集和模型,以促进个性化 T2I 对齐和主观视觉质量评估的标准化研究。