论文

ReCA:通过递归上下文分配进行多镜头长视频外推

ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation

上下文与知识上下文工程

摘要

分钟级电影视频生成是生成视频模型的主要挑战。现有的范式仅解决了这一挑战的一部分:单镜头外推保留了锚点,但缺乏电影结构,而多镜头叙事强加了结构,但仍然可以自由地创造其视觉状态,而不是继续观察到的状态。我们定义了多镜头视频外推(MSVE),这是一项将观察到的帧或剪辑扩展为电影结构镜头序列的任务,同时保留锚点状态并推进叙事意图。此设置在短视频模型的有限每次调用生成预算下运行。我们确定了三个耦合瓶颈:(1)全局规划者过度指定完整剧本中不受支持的细节; (2)在承载完整故事时,镜头级提示淡化了任务相关状态; (3)时间链将生成的帧变成有损记忆,其中身份、场景、对象和动作状态会衰减。 MSVE揭示了长视频失败不仅仅是上下文长度的限制,而是上下文分配的失败。我们提出了递归上下文分配(ReCA),这是一种推理时间框架,可以跨规划和生成分层分配上下文。 ReCA 递归地将 MSVE 分解为上下文限制的子问题,在叶节点调用冻结的生成器,并跨时间传播结构化状态更新。为了评估这一设置,我们进一步提出了 MSVE-Bench 和 NB-Q,这是一种基于源的协议,带有专门为 3 到 5 分钟的长视频生成而构建的提示,这是现有的短剪辑基准测试未解决的机制。与以前的方法相比,ReCA 比最强的竞争控制器将平均归一化分数提高了 8% 至 16%,并将多镜头一致性指标提高了 28% 至 43%。查看项目页面:https://reca.vmv.re。