论文

组合奖励下流模型的冲突感知加性引导

Conflict-Aware Additive Guidance for Flow Models under Compositional Rewards

模型推理解码与生成控制

摘要

推理时引导采样将生成过程解释为一条可控轨迹,从而无需微调即可引导最先进的扩散模型与流模型。这为注入外部约束(如代价函数或预训练验证器)以实现受控生成提供了简单而灵活的方式。然而,现有方法在同时组合多个约束时常会失败,导致偏离真实数据流形。在这项工作中,我们识别了这种流形外漂移的根源,并发现近似误差随梯度不对齐程度急剧增大。基于这些发现,我们提出冲突感知加性引导($g^\text{car}$),这是一种轻量且可学习的方法,通过动态检测并化解梯度冲突来主动纠正流形外漂移。我们在多个领域验证 $g^\text{car}$,范围涵盖合成数据集、图像编辑,以及面向规划与控制的生成式决策。结果表明,$g^\text{car}$ 能有效纠正流形外漂移,在计算开销较小的情况下于生成保真度上超越基线。代码发布于 https://github.com/yuxuehui/CAR-guidance。

组合奖励下流模型的冲突感知加性引导:论文配图
图 1:在推理时,我们的目标是从倾斜目标 p1′​(x1)∝p1base​(x1)​er⁡(x1)p^{\prime}_{1}(x_{1})\propto p_{1}^{\text{base}}(x_{1})e^{r(x_{1})} 进行采样。 (b-c) 单个奖励重新调整特定属性(“红色”或“狗”)的分布权重。 (d) 在组合奖励(“红色”和“狗”)下,理想样本位于高奖励区域的交叉点(⋆\star,);然而,现有的方法经常遭受流形漂移(即扭曲的图像,∙\bullet,)。