论文

推测解码 用于自回归视频生成

Speculative Decoding for Autoregressive Video Generation

模型推理投机采样

摘要

自回归视频扩散正在成为流视频合成的一种有前途的范例,其中步骤 蒸馏 是加速推理的主要手段。 推测解码(大语言模型 的主要加速策略)能否有效地适应自回归视频生成仍然是一个悬而未决的问题,因为视频块是连续的时空张量,没有用于精确拒绝采样的 词元级 分布。我们引入了 SDVG,它通过用图像质量路由器取代词元验证,将 推测解码 引入基于块的自回归视频扩散。 1.3B 起草者通过四个去噪步骤提出候选块;每个块都经过 VAE 解码,并由 ImageReward 使用最差帧聚合进行评分——采用最小每帧奖励来捕获平均会掩盖的单帧伪影。得分高于固定阈值 tau 的块将被接受到 14B 目标的 KV 缓存中;其余的由目标重新生成。事实证明,另外两个设计选择至关重要:第一个块始终被强制拒绝以锚定场景构图,而 tau 则充当追踪平滑质量速度帕累托前沿的单个旋钮。在 1003 MovieGenVideoBench 提示 (832x480) 上,SDVG 在 tau=-0.7 的情况下以 1.59 倍加速,保留了 98.1% 的仅目标 VisionReward 质量(0.0773 与 0.0788),并在 95.7% 的质量保留下达到 2.09 倍,同时始终优于仅草稿生成超过 17%。该框架为 无需训练,不需要进行架构更改,并且可以无缝集成到现有的自回归视频生成管道中。