论文
MVAgent:以条件构造和逐镜头强化学习保持视频连续性
MVAgent: Multi-Agent Video Generation via Consistent Condition Construction and Shot-Level Policy Optimization
摘要
多镜头 Agentic 视频生成需要一致的角色外观、跨摄像机角度的稳定空间布局以及镜头之间连续的角色状态。当每个镜头都是对冻结生成器的单独请求时,重复的文本并不能确定外观、布局或状态。因此,我们将问题重新定义为条件构建,并提出 MVAgent,这是一个多智能体管道,其智能体通过类型化条件输入进行协作。由于环境图像显示一个视点,因此空间定位智能体会从生成的摄像机遍历剪辑中对视图进行采样,并将每个镜头锚定到与其取景匹配的视图。当生成的镜头偏离计划时,观察者会在连续性记忆中记录每个镜头的结束方式,过渡代理从中构建下一个镜头的角色动作和空间参考。 Orchestrator 将这些输入组合到每个请求中。由于请求只有在渲染后才会显示其效果,因此我们通过 Trunk-GDPO 进行Agentic 强化学习来训练它,它会在每个镜头中比较渲染的候选者,而不是每个视频一次,并继续将最好的作为主干。在生成器和判断器冻结的情况下,MVAgent 在 ViMax-Bench 上的比较方法中获得了最高的交叉镜头一致性和叙事规划质量,并且优于人类评估中最强的代理基线。
