论文

Flow-Direct:通过非参数指导场为流动模型提供反馈高效且可重复使用的指导

Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field

模型推理解码与生成控制

摘要

无需训练 指导使预先训练的扩散和流动模型能够使用外部黑盒奖励功能的反馈来优化特定于应用程序的目标。然而,现有的方法反馈效率低下,因为奖励反馈仅短暂地用于通知局部梯度近似或离散搜索决策,并且随后被丢弃。为了解决这个限制,我们提出了 Flow-Direct,这是一个通过持久指导字段指导生成过程的框架。理论上,该指导场是从基本分布和奖励加权目标分布之间的对数密度比分析得出的;它将预先训练的分布传输到目标分布。在实践中,该字段被实现为由所有累积的奖励评估样本构建的非参数估计器。随着优化过程中收集的样本越来越多,这个经验指导领域变得越来越准确。这种持久的配方有两个主要优点。首先,Flow-Direct 具有很高的反馈效率:因为每个评估的样本都用于细化全局指导领域,因此不会浪费任何奖励信息。其次,该框架自然是可重用的:一旦优化完成,收集的数据集定义了一个可重用的指导字段,用于生成新的目标样本,而无需额外的奖励评估,并且可以组合不同的指导字段来生成同时满足多个目标的样本。