论文

Stream-T1:流视频生成的测试时间缩放

Stream-T1: Test-Time Scaling for Streaming Video Generation

模型推理测试时计算扩展

摘要

虽然测试时间缩放(TTS)提供了一个有希望的方向来增强视频生成,而无需高昂的训练成本,但当前基于扩散模型的测试时间视频生成方法面临过高的候选探索成本并且缺乏时间指导。为了解决这些结构性瓶颈,我们建议将重点转移到流视频生成上。我们发现它的块级合成和很少的去噪步骤本质上适合 TTS,显着降低了计算开销,同时实现了细粒度的时间控制。在这一见解的推动下,我们推出了 Stream-T1,这是一款专为流媒体视频生成量身定制的开创性综合 TTS 框架。具体来说,Stream-T1由三个单元组成:(1)Stream-Scaled Noise Propagation,它使用历史证明的高质量先前块噪声主动细化生成块的初始潜在噪声,有效地建立时间依赖性并利用历史高斯先验来指导当前生成; (2) Stream-Scaled Reward Pruning,通过将即时短期评估与基于滑动窗口的长期评估相结合,综合评估生成的候选者,以在局部空间美观性和全局时间一致性之间取得最佳平衡; (3) 流级内存下沉,它将从 KV 缓存中逐出的上下文动态路由到由奖励反馈引导的不同更新路径中,确保先前生成的视觉信息有效地锚定和引导后续视频流。在 5 秒和 30 秒综合视频基准测试中,Stream-T1 表现出了巨大的优越性,显着提高了时间一致性、运动平滑度和帧级视觉质量。