论文
DramaAgent:Agentic 讲故事视频生成
DramaAgent: Agentic Storytelling Video Generation
摘要
最近的扩散和自回归模型极大地改进了文本到视频的生成,但制作具有一致字符和对齐音频的连贯长篇故事视频仍然具有挑战性。现有的方法经常遭受叙事漂移、角色身份不稳定、跨场景连续性弱以及扩展序列的视听不匹配等问题。我们提出了 DramaAgent,这是一个分层的、Agentic 的、与模型无关的框架,用于生成长格式文本到视频和音频。 DramaAgent 没有改进底层视频主干本身,而是引入了上层控制层,将生成分解为故事规划、持久角色调节、场景合成和反射引导的有针对性的修复。该框架跨场景维护可重用的故事和角色状态,诊断身份漂移、场景语义缺失、时间不连续性和跨模式不匹配等故障,并以特定于阶段的方式修复有问题的剪辑。跨多个视频生成主干的实验表明,与直接生成和强基线相比,DramaAgent 提高了长程连贯性、角色一致性、叙事保真度和场景级视听一致性。这些结果表明分层 Agentic 控制是可控长格式视听生成的实用方向。代码:https://github.com/AIGeeksGroup/DramaAgent. 网站:https://aigeeksgroup.github.io/DramaAgent.