论文

Co-Director:智能体化生成式视频叙事

Co-Director: Agentic Generative Video Storytelling

智能体系统Agent 协作

摘要

尽管扩散模型能够生成高保真的视频片段,但将其转化为连贯的叙事引擎仍具挑战。当前的智能体流水线通过链式模块将其自动化,但由于各模块相互独立且提示依赖手工打造,容易遭受语义漂移和级联失败的影响。我们提出 Co-Director,一个将视频叙事形式化为全局优化问题的分层多智能体框架。为确保语义连贯,我们引入分层参数化:多臂老虎机在全局层面识别有前景的创作方向,而局部的多模态自细化循环则缓解身份漂移并保证序列级一致性。这在探索新颖叙事策略与利用有效创作配置之间取得了平衡。为进行评估,我们引入 GenAD-Bench,一个包含 400 个虚构产品场景的个性化广告数据集。实验表明,Co-Director 显著优于最先进的基线,提供了一种可无缝泛化到更广泛影视叙事的原则性方法。项目主页:https://co-director-agent.github.io/

Co-Director:智能体化生成式视频叙事:论文配图
图 1:Co-Director 多代理管道:(上):Orchestrator Agent (Φo​r​c​h\Phi_{orch}) 利用 MAB 导航因子创意动作空间 θ=(θc​s,θn​m,θa​a)\theta=(\theta_{cs},\theta_{nm},\theta_{aa})。 (下):预制作代理 (Φp​r​e\Phi_{pre}) 综合创意简报 (ℬ\mathcal{B})、故事情节 (ℒ\mathcal{L}) 和视觉资源 (𝒱\mathcal{V}),以建立一致的故事板 (𝒮\mathcal{S}),制作代理将其(Φp​r​o​d\Phi_{prod}) 转换为同步关键帧 (𝒦\mathcal{K})、视频剪辑 (𝒞\mathcal{C}) 和音频 (𝒜\mathcal{A})。 MLLM Judge 评估最终视频 (FF) 以生成因子奖励信号 R=(rc​s,rn​m,ra​a)R=(r_{cs},r_{nm},r_{aa}),该信号被传播回 MAB,以通过 TT 优化循环迭代地细化创意配置。