论文

OPSD-V:同策略 Self-蒸馏,适用于 后训练 少步自回归视频生成器

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

摘要

我们提出了 OPSD-V,这是一种用于 后训练 少步自回归(AR)视频扩散模型的 同策略 自 蒸馏 范例。现有的几步 AR 视频生成器可以生成低延迟的长视频,但在长时间自回归轨迹展开过程中仍然会遇到错误积累和运动动态减弱的问题。 OPSD-V 减少了长期退化,同时保留了原始的几步推理路径。关键思想是在训练期间引入真实的长视频数据作为时间上下文,并用它来提供密集的轨迹级监督。具体来说,学生遵循精确的推理时间轨迹展开,根据其自己之前生成的 KV 缓存生成每个块。同时,教师在与学生访问的相同去噪状态下进行评估,但使用更干净的 AR 一致的时间缓存,其中较旧的历史可以被真实视频上下文替换。这在 同策略 AR 缓存动态下提供了密集的去噪级校正目标,而无需更改采样器、去噪步骤数或推理时间缓存机制。我们将 OPSD-V 应用于代表性的几步 AR 视频模型,包括 Self-Forcing 和 LongLive。实验表明视觉质量、运动动力学和 VBenchLong 分数持续改善。一项由 10 名参与者对 20 个视频对进行比较的用户研究表明,在 66.0% 的总体偏好判断中,OPSD-V 优于基本模型(82.5% 不包括平局)。