论文
ZIPP:从人设零样本图像个性化
ZIPP:Zero-shot Image Personalization from Personas
摘要
文生图扩散模型越来越多地部署在开放式创意环境中,但它们的输出仍然是非个人化的,针对总体美学而不是个人品味进行了优化。人类的偏好是多元的:一个喜欢柔和、怀旧的肖像的用户可能更喜欢充满活力的街头摄影,而另一个则倾向于梦幻般的电影美学。现有方法需要密集的交互历史或每个用户的微调,冷启动设置失败并将依赖于上下文的首选项折叠为静态表示。我们引入了来自角色的零样本图像个性化(ZIPP),它在自然语言角色(用户身份和审美情感的简明描述符)上生成图像,无需任何特定于用户的数据或权重更新。 ZIPP 使用大语言模型从给定角色的角度重写提示,将扩散模型转向个性化输出。为了大规模挖掘角色,我们在 2200 万用户的 Reddit 交互图上训练归纳图注意力网络,并具有双重对比目标,使图结构与视觉行为保持一致,然后通过 MLLM 将学习到的表示形式语言化为自然语言角色。我们推出了 ZIPBench,这是第一个零样本个性化基准测试,拥有 1.5K 用户、图形挖掘角色和 40K 生成图像。在跨越五个模型系列的四个基准和 14 个大语言模型中,角色调节产生了持续的收益 (13-20%),其中前沿模型受益最多。在少样本设置中,ZIPP 匹配或超过了每个用户在 100 多个示例上训练的微调基线。 ZIPP 实现了最低的偏好分布差异(CMMD 0.16 与 0.55),IPF 标准化人口统计评估表明它大大减少了现有方法中存在的亚群体偏差。人工评估证实,与通用生成相比,胜率高达 79%,与所有微调基线相比,胜率高达 58-65%。
