论文
RAVEN:具有一致性模型 GRPO 的实时自回归视频外推
RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO
摘要
因果自回归视频扩散模型通过从先前生成的内容推断未来的块来支持实时流生成。从高保真双向教师中提取此类生成器可以产生具有竞争力的几步模型,但训练期间遇到的历史分布与推理过程中出现的历史分布之间持续存在的差距限制了长期的生成质量。我们引入了实时自回归视频外推网络(RAVEN),这是一种训练时测试框架,它将每次自采样轨迹重新打包为干净的历史端点和噪声去噪状态的交错序列。该公式将训练注意力与推理时间外推结合起来,并允许下游块损失来监督未来预测所依赖的历史表示。我们进一步提出了一致性模型组相对策略优化(CM-GRPO),它将一致性采样步骤重新表述为条件高斯转换,并将在线强化学习(RL)直接应用于该内核,避免了先前流模型 RL 公式中采用的 Euler-Maruyama 辅助过程。实验表明,RAVEN 在质量、语义和动态程度评估方面超越了最近的因果视频 蒸馏 基线,并且 CM-GRPO 与 RAVEN 结合时提供了进一步的收益。