论文

AdaState:用于流视频生成的自我进化锚点

AdaState: Self-Evolving Anchors for Streaming Video Generation

模型推理KV Cache

摘要

自回归视频扩散模型通过顺序生成帧来生成流视频,并根据先前生成的内容调节每个块。这些模型在结构上锚定到第一帧:其键值表示在注意力缓存中占据特权位置,并在整个生成过程中充当主要场景参考。作为缓存中最干净、最无错误的位置,该锚点吸引了过多的注意力,抑制了视频动态,并将场景构图锁定到初始视点,即使场景自然演变也是如此。结果是一个时间上浅的视频,其中运动、摄像机移动和场景进展都被抑制,以利于静态一致性。为了解决这个问题,我们用自适应状态替换静态锚点,这是一种隐藏的潜在状态,模型在每个块上与内容一起去噪,但从不渲染。该模型不是引用冻结的第一帧,而是通过关注先前状态和当前内容,在每一步生成自己的场景锚点,生成随生成内容一起演变的引用。与对时间的绝对概念进行编码的标准视频生成不同,我们的公式将时间视为相对的:无论生成进度如何,每个生成步骤都会看到相同的位置结构,并且每个块的状态转换都是相同的。这些属性共同在生成过程中引入了递归,其中去噪作为转换函数,KV缓存作为载体,不需要外部模块。实验表明,自适应状态极大地改善了视频动态,从而在生成的视频中实现更丰富的运动和自然的场景进展。