论文

Memento:以主体重建监督保持长视频一致性

Memento: Reconstruct to Remember for Consistent Long Video Generation

摘要

长视频生成需要重复出现的主体在各种镜头、视点、动作和场景转换中保持一致。现有的时间分解方法通过生成逐个镜头的视频来提高可扩展性。然而,他们主要关注于优化合理的下一个镜头延续,而不验证历史记忆是否保留了身份关键的主体证据。因此,随着生成推进,重复出现的主体可能会被淡化、覆盖或遗忘。在本文中,我们提出了 Memento,一个以主体重建为导向的框架,它将主体保存视为一个明确的身份保持问题,其前提是忠实地保存主体的记忆库应该支持仅从记忆中重建该主体。具体来说,Memento 联合训练自回归下一镜头生成与基于记忆的主体重建,使用历史记忆和全局故事描述恢复目标外观。为了将远程主体证据与短程线索分开,Memento 引入了一种双查询记忆机制,其中一个查询检索与身份相关的记忆,另一个查询选择短上下文关键帧以实现连贯的延续。此外,主体感知的电影数据管道通过一致的、无代词的主体描述提供精确的重建监督。实验表明,Memento 在长期主体一致性、跨镜头连贯性和视觉质量方面实现了最先进的性能。