论文
RewardFlow:通过优化奖励内容来生成图像
RewardFlow: Generate Images by Optimizing What You Reward
摘要
我们引入了 RewardFlow,这是一种无反演框架,可通过多奖励 Langevin 动力学在推理时引导预训练的扩散和流匹配模型。 RewardFlow 统一了语义对齐、感知保真度、本地化基础、对象一致性和人类偏好的互补可微奖励,并进一步引入了基于 VQA 的可微奖励,通过语言视觉推理提供细粒度的语义监督。为了协调这些异构目标,我们设计了一种提示感知自适应策略,该策略从指令中提取语义原语,推断编辑意图,并在整个采样过程中动态调整奖励权重和步长。在多个图像编辑和构图生成基准中,RewardFlow 提供最先进的编辑保真度和构图对齐。