论文

FrameMorrow:具有用于长视野视频生成的前瞻性词元的未来引导帧选择

FrameMorrow: Future-guided Frame Selection with Prospective Tokens for Long-Horizon Video Generation

上下文与知识上下文工程

摘要

长视野视频生成需要模型有效地利用越来越长的生成历史。随着生成的历史记录的增长,保留所有以前的内容变得越来越昂贵和多余,因此有效的历史选择至关重要。现有方法通常根据当前内容确定历史相关性。然而,与现在相关的信息不一定对后代有用,而看似不太相关的历史可能在以后变得很重要。我们的主要见解是,应根据历史信息与未来信息需求的相关性来选择历史信息。满足这些需求并不需要创造完整的未来;相反,对接下来变得重要的事情的紧凑描述足以指导历史选择。基于这一见解,我们提出了 FrameMorrow,这是一种预期框架选择器,它可以预测一小组代表未来信息需求的预期词元,并使用它们来识别历史中的相关信息。 FrameMorrow 选择明确的历史帧而不是特定于模型的内部状态,从而实现跨不同生成器(包括闭源模型)的即插即用集成,几乎不需要额外的推理成本。我们通过五个基准和 11 个生成模型(涵盖长视频生成、交互式生成和动作条件世界模型)对 FrameMorrow 进行评估。大量的实验表明,在不同的生成环境中,远程一致性、视觉质量和动作对齐都得到了持续改进。