论文

通过文本反转实现对象的零样本个性化

Zero-Shot Personalization of Objects via Textual Inversion

应用与实践内容创作

摘要

文本到图像扩散模型的最新进展极大地提高了图像定制的质量,从而能够合成高度逼真的图像。尽管取得了这些进展,实现快速高效的个性化仍然是一个关键挑战,特别是对于现实世界的应用程序而言。现有方法主要通过将特定于身份的嵌入注入扩散模型来加速人类受试者的定制,但这些策略不能很好地推广到任意对象类别,从而限制了它们的适用性。为了解决这一限制,我们提出了一种新颖的框架,该框架采用学习网络来预测特定于对象的文本反转嵌入,随后将其集成到扩散模型的 UNet 时间步中以进行文本条件定制。这种设计可以在一次前向传递中对各种对象进行快速、零样本的个性化,从而提供灵活性和可扩展性。跨多个任务和设置的广泛实验证明了我们方法的有效性,突出了其支持快速、多功能和包容性图像定制的潜力。据我们所知,这项工作代表了在扩散模型中实现这种通用 无需训练 个性化的首次尝试,为个性化图像生成的未来研究铺平了道路。