论文
组合奖励下流模型的冲突感知加性引导
Conflict-Aware Additive Guidance for Flow Models under Compositional Rewards
摘要
推理时引导采样将生成过程解释为一条可控轨迹,从而无需微调即可引导最先进的扩散模型与流模型。这为注入外部约束(如代价函数或预训练验证器)以实现受控生成提供了简单而灵活的方式。然而,现有方法在同时组合多个约束时常会失败,导致偏离真实数据流形。在这项工作中,我们识别了这种流形外漂移的根源,并发现近似误差随梯度不对齐程度急剧增大。基于这些发现,我们提出冲突感知加性引导($g^\text{car}$),这是一种轻量且可学习的方法,通过动态检测并化解梯度冲突来主动纠正流形外漂移。我们在多个领域验证 $g^\text{car}$,范围涵盖合成数据集、图像编辑,以及面向规划与控制的生成式决策。结果表明,$g^\text{car}$ 能有效纠正流形外漂移,在计算开销较小的情况下于生成保真度上超越基线。代码发布于 https://github.com/yuxuehui/CAR-guidance。
