论文

NormGuard:流量匹配强化学习中的奖励保留规范约束

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 后训练 改善了基于流的生成器的奖励对齐,但通常会以奖励代理无法捕获的方式降低感知质量。我们确定了这种漂移的一个简单的结构特征:在三种 后训练 方法(NFT、AWM、DPO)中,RL 微调 相对于参考将每步速度范数 $\|v_θ\|$ 膨胀了 $5\%$ 到 $15\%$。在无分类器指导(CFG)中研究了一种形式的范数膨胀,其中在推理时将速度重新调整回参考范数可以减轻由此产生的伪影。然而,这种推理时间修正并没有干净地转移到 RL:在推理时间重新调整 $v_θ$ 以匹配 $\|v_{\text{ref}}\|$ 既不能提高奖励,也不能修复质量下降,因为通货膨胀是与模型权重共同适应的。此外,伴随敏感性分析表明,速度幅度重新调整在批次级别上没有连贯的一阶奖励信号,这表明抑制常态通货膨胀不太可能消除持续的奖励成分。由于推理时重整化失败,而规范抑制没有奖励成本,因此训练时干预是适当的策略。总之,这些发现激发了 NormGuard,这是一种铰链惩罚,仅当 $\|v_θ\|$ 超过 $\|v_{\text{ref}}\|$ 时激活,并与任何速度局部基本损失相加。在两个基本模型、三个 后训练 方法和两个奖励代理中,NormGuard 不断提高 MLLM 判断的图像质量和取证真实性,同时保留奖励,其收益在几步推理下会放大,并且不能通过提前停止来解释。