论文

测试时弱到强对齐:将隐式奖励从弱流模型转移到强流模型

Test-Time Weak-to-Strong Alignment: Transferring Implicit Rewards from Weak to Strong Flow Models

模型推理解码与生成控制

摘要

将文本到图像生成流模型与奖励相结合,使其能够遵循训练数据本身无法提供的目标。对齐 微调 通过强化学习 (RL) 或偏好优化来实现这一点,但它必须对每个检查点重复,并返回一个固定于训练时的奖励和强度的模型。相反,测试时间对齐在采样期间引导冻结模型,从而允许特定于任务和特定于样本的指导。现有的方法只能通过从奖励函数本身、通过其梯度或通过单独训练的值函数提取每步信号来实现这一点。我们建议改变监督来源:让一对弱模型(而不是奖励函数)提供监督。源对齐模型与其基础作为源对齐对保持在一起,将其训练奖励存储为以采样器自己的坐标表示的隐式、逐步、KL 锚定信号。我们探索这种模型形式的监督是否可以跨尺度,并证明它确实可以:我们的方法 AlignGraft 通过在采样期间添加配对的速度差来对齐更大的、冻结的、从未调整的模型。传输在共享噪声内核下是精确的,并且在测试时既不需要奖励也不需要梯度。该方法没有时间表,只有一个标量来控制对齐强度,并可以将其推断到源对齐对的强度之外。在图像和视频流模型(Stable Diffusion 3.5、FLUX 和 Wan)中,传输在偏好、构图和文本渲染奖励方面提升了冻结的大型模型,可以超过源对齐模型本身,并以较小的恒定采样开销保持大型模型的保真度。大量实验表明,在弱模型上运行的一次对齐会产生整个模型系列可以在测试时重用的监督。