论文

长视频的闭环三元组协同生成

Closed-Loop Triplet Synergistic Generation for Long-Form Video

智能体系统Agent 架构与控制循环

摘要

由于身份漂移和镜头之间的不一致,多镜头长视频生成仍然具有挑战性。虽然故事板驱动的管道提高了可控性,但它们通常以前馈方式执行,并且将生成的视觉证据合并回后续调节的机制有限。我们提出了 CoTriSyGen,一种代理框架,它将多镜头长视频生成制定为闭环视觉文本记忆协同过程,其中计划意图、持久记忆和生成的视觉效果共同用于迭代校正和远程连贯性。基于视觉语言模型的分析器对这个三元组进行推理,并沿着两条路径对提示和记忆进行更新:(i)镜头内细化,当检测到语义或构图违规时触发有针对性的再生,并细化图像到视频的提示以实现连贯的运动; (ii) 镜头间细化,重写后续镜头提示,以传播新表现的实体或属性,并根据生成的证据提高提示质量(例如,构图与证据的对应和电影流畅性)。该循环基于以实体为中心的记忆,该记忆被建模为随着故事的进展而演变的可变视觉状态,生成器和分析器通过添加新的和进化的实体来不断更新该记忆,以反映外观变化、积累的多视图证据和多实体组合。我们策划的 StoryBench 基准测试表明,与代表性方法相比,跨镜头一致性、即时依从性和电影连续性方面有了显着改进。