论文

A$^2$RD:用于长视频一致性的代理自回归扩散

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

模型架构新型架构

摘要

合成一致且连贯的长视频仍然是一个基本挑战。现有的方法在长期的视野中会遭受语义漂移和叙事崩溃的困扰。我们提出了 A$^2$RD,一种代理自回归扩散架构,它将创造性合成与一致性执行分离。 A$^2$RD将长视频合成制定为一个闭环过程,通过Retrieve--Synthesize--Refine--Update循环逐段合成和自我改进视频。它由三个核心组件组成:(i) 多模态视频存储器,用于跟踪跨模态的视频进展; (ii) 自适应片段生成,可在生成模式之间切换,以实现自然进展和视觉一致性; (iii) 分层测试时自我改进,在帧和视频级别自我改进每个分段,以防止错误传播。我们进一步介绍了 LVBench-C,这是一个具有挑战性的基准,具有非线性实体和环境转换,可以对长期一致性进行压力测试。在涵盖一到十分钟视频的公共和 LVBench-C 基准测试中,A$^2$RD 在一致性方面比最先进的基线高出 30%,在叙述连贯性方面高出 20%。人类评估证实了这些成果,同时也强调了运动和过渡平滑度的显着改进。