论文

Stream-R1:用于流视频生成的可靠性-困惑感知奖励 蒸馏

Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation

摘要

基于 蒸馏 的加速已成为使自回归流视频扩散模型实用的基础,其中分布匹配 蒸馏 (DMD) 作为事实上的选择。然而,现有的方法训练学生不加区别地匹配教师的输出,将每个滚动、帧和像素视为同样可靠的监督。我们认为,这限制了蒸馏质量,因为它忽略了 DMD 监督中两个互补的方差轴:学生采样轨迹的相互可靠性,其监督的可靠性各不相同,以及跨空间区域和时间框架的内部困惑,它们对质量仍然可以提高的地方贡献不均。因此,该目标将两个问题合并在一个统一的权重下:是否从每次部署中学习,以及在其中集中优化的地方。为了解决这个问题,我们提出了 Stream-R1,一种可靠性-困惑感知奖励 蒸馏 框架,它通过单个共享奖励引导机制在采样轨迹和时空元素级别自适应地重新加权 蒸馏 目标。在内部可靠性级别,Stream-R1 按预训练视频奖励分数的指数重新调整每次采样轨迹的损失,以便具有可靠监督的采样轨迹主导优化。在内部困惑级别,它反向传播相同的奖励模型来提取每个像素的梯度显着性,该显着性被分解为空间和时间权重,将优化压力集中在细化产生最大预期增益的区域和帧上。自适应平衡机制可防止任何单一质量轴在视觉质量、运动质量和文本对齐方面占主导地位。 Stream-R1 在标准流视频生成基准上比 蒸馏 基线在所有三个维度上实现了一致的改进,无需架构修改或额外的推理成本。