论文
PreviewDiff:多模态评论家引导的扩散潜伏搜索
PreviewDiff: Multimodal Critic-Guided Search over Diffusion Latents
摘要
扩散模型可以产生引人注目的图像和视频,但它们仍然难以解决使一代人忠实于提示的构图细节,例如对象计数、属性绑定、空间关系和基于时间的动作。提高即时满意度的常见方法是通过 Best-of-N 采样在测试时花费更多计算,但最终样本选择是固定的。 Best-of-N 只能在已完成的输出中进行选择,并且无法在失败之前修复有希望的轨迹。我们引入了 PreviewDiff,这是一种免训练的测试时搜索方法,它将标量搜索的扩散采样转变为针对中间潜在变量的多模态评论家引导搜索。在选定的去噪检查点,PreviewDiff 对部分预览进行解码,要求多模态评审对其进行评分和评论,并使用生成的自然语言反馈来对语义提示编辑和本地重新降噪的潜在延续进行分支。然后对这些分支进行评分并有选择地前滚,从而允许验证者计算在样本仍然可编辑的同时指导生成。在图像和视频生成基准中,PreviewDiff 持续改进了预算匹配的 Best-of-N 选择和强大的标量搜索基准。消融表明,早期干预和增加搜索宽度提供了最大的收益,而更深层次的搜索和其他语义变体则提供了互补的改进。 PreviewDiff 证明多模态反馈不仅作为最终验证器最有用,而且作为去噪过程中的主动控制器也是最有用的。