论文
测试时个性化:从用户偏好引导图像生成
Personalize at Test Time: Learning User Preferences for Image Generation
摘要
扩散模型可以生成高质量的图像,但将其输出与个人用户偏好保持一致仍然具有挑战性。一个关键瓶颈是根据有限的反馈准确地建模不同的用户偏好。现有方法通常依赖于劳动密集型的手动偏好注释或视觉语言模型(VLM)来从用户交互历史中提取偏好信息,从而引入大量注释或限制可扩展性的计算成本。我们提出了一种直接从用户的历史图像偏好对中学习个性化奖励模型的方法。首先,我们使用自动编码器将数百个视觉属性压缩为 50 个属性锚定的偏好维度,并训练评估器沿着这些维度对图像进行评分。然后,我们将每个用户的偏好表示为共享维度得分的线性组合,通过最大化 Bradley-Terry 模型下观察到的成对偏好的可能性来估计用户特定的权重。这种公式减少了每个用户对优化低维权重向量的适应,简化了优化并通过稀疏反馈实现数据高效的个性化。学习到的个性化奖励指导推理时的图像生成,同时保持扩散模型冻结。对真实用户偏好数据的实验表明,我们的方法实现了大约 77% 的成对偏好预测精度,并提高了生成的图像与个人用户偏好的一致性。
