论文
用于少步视觉生成的奖励感知轨迹塑造
Reward-Aware Trajectory Shaping for Few-step Visual Generation
摘要
长期以来,以极少的采样步骤实现高保真生成一直是生成建模的核心目标。现有的方法很大程度上依赖于基于 蒸馏 的框架将原始的多步骤去噪过程压缩为几个步骤的生成器。然而,这种方法本质上限制了学生模仿更强的多步骤教师,将教师强加为学生表现的上限。我们认为,引入 \textbf{偏好对齐意识} 使学生能够优化奖励偏好的生成质量,有可能超越教师,而不是仅限于严格的教师模仿。为此,我们提出了 \textbf{奖励感知轨迹塑造(RATS)},这是一个用于偏好对齐的少步生成的轻量级框架。具体来说,教师和学生的潜在轨迹通过水平匹配在关键去噪阶段对齐,同时引入\textbf{奖励感知门}来根据教师的相对奖励表现自适应地调节教师指导。当老师获得更高的奖励时,轨迹塑造就会加强,而当学生匹配或超越老师时,轨迹塑造就会放松,从而实现持续的奖励驱动改进。通过无缝集成轨迹 蒸馏、奖励感知门控和偏好对齐,RATS 有效地从高步生成器传输偏好相关知识,而不会产生额外的测试时计算开销。实验结果表明,RATS 极大地提高了少步视觉生成的效率-质量权衡,显着缩小了少步学生与更强的多步生成器之间的差距。