论文

同策略 用于自回归视频生成的对抗流 蒸馏

On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

摘要

自回归视频生成器对于流媒体、长视野和交互式应用程序很有吸引力,但将强大的黑盒教师提炼成随意的学生仍然很困难。学生必须在自己的轨迹采样分布下学习,而实际教师可能只展示经过提示条件的完整视频,并且在架构、容量、时间设计和采样时间表方面可能有所不同。该接口使得有监督的 微调 离策略、基于分数的 蒸馏 不适用,并且直接对抗性模仿对于去噪时间贡献分配来说过于稀疏。我们提出了对抗流 蒸馏 (AFD),这是一种用于异构黑盒视频 蒸馏 的 同策略 框架。 AFD 查询教师并在相同的提示下轨迹采样当前学生,训练提示配对的 Bradley-Terry 判别器来估计干净样本的师生差异,并将所得的 同策略 优势转换为学生自己的噪声状态的前向处理流匹配更新。因此,AFD 提供密集的速度场监督,同时不需要教师分数、潜伏、去噪轨迹、步骤对齐或反向链强化学习。两个因果 AR 学生家庭的实验表明,AFD 持续改进运动和物理敏感的生成,同时保持一般视频质量,并且消融验证了自适应 同策略 反馈和前向处理学分分配的重要性。该方法只需要干净的教师视频和学生展示,为将专有或异构视频生成器提炼成高效的自回归学生提供了实用的途径。