论文

TILT:利用模型内在奖励改进扩散模型的组合性生成

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

模型推理解码与生成控制

摘要

强大的文生图模型的最新进展,使得开发在测试时修改采样轨迹、生成更忠实于复杂组合提示的图像的方法日益重要。我们提出TILT,一个通过测试时奖励对齐实现组合性文生图的免训练框架。我们将组合失败解释为联合分布与单概念分布之间的重叠模式,并定义了一个偏好所有概念共同出现的样本的奖励。该奖励是基础模型内在的,不需要任何外部监督或奖励模型。这得到一个带KL约束的目标,其倾斜目标分布具有闭式解,并为扩散采样提供了有原则的引导步骤。概念分布的交互与上述奖励自然产生了两种不同的引导策略,而平衡二者各自优点的混合方法带来更强的性能。在T2ICompBench提示上的实验表明,与以往基线相比,我们的方法在保持图像质量的同时改善了组合对齐。

TILT:利用模型内在奖励改进扩散模型的组合性生成:论文配图
图 1:每个子提示 c1,c2c_{1},c_{2} 与生成的图像之间的对齐分数 (DINOv2) 直方图。文本提示的形式为“A [Animal] and a [Object]”。