论文

RL-Native 蒸馏:利用评分轨迹进行少步图像生成

RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation

摘要

高效的文本到图像生成需要基于强化学习 (RL) 的奖励对齐和几个步骤 蒸馏,但这些过程通常按顺序执行,从而增加了训练成本并冒着在压缩期间损失奖励增益的风险。我们采用 RL 原生的视角:扩散 RL 已经生成了奖励评分的有限步轨迹,其中间状态提供了 蒸馏 监督。基于这一见解,我们提出了 REST(奖励增强评分轨迹 蒸馏),这是一种单阶段协同训练框架,其中解耦的学生可以从不断发展的 RL 教师轨迹中学习,而无需改变教师优化。优势调制 蒸馏 (AMD) 将轨迹优势转化为带符号权重,加强对首选轨迹的模仿,并使 蒸馏 优先级与任务价值保持一致。由此产生的框架是通用且轻量级的,不需要额外的图像展示,不需要单独的 蒸馏 数据集,也不需要对抗性训练。关于构图生成、视觉文本渲染和人类偏好对齐的实验展示了 RAM 或 DiffusionNFT 教师的竞争性少步、无 CFG 生成。仅用四个采样步骤,REST-RAM 就获得了 23.97 的 DrawBench PickScore,优于 40 步 RAM 教师 (23.95) 和 RTDMD (23.71)。