论文
VideoGen-Agent:增强视频生成代理
VideoGen-Agent: Reinforcing Video Generation Agents
摘要
视频生成模型的最新进展已经实现了高保真、时间连贯的视频生成。然而,这些模型通常难以满足需要专业知识、特定身份、物理一致性或有序事件的提示。在本文中,我们提出了 VideoGen-Agent,这是一种通过多任务代理强化学习训练的多模式代理,可使用外部工具生成视频。代理通过多轮交互来协调增强、生成和验证工具,使用即时和中间观察来指导其决策。我们在涵盖六个任务的类别平衡数据集上训练共享策略。对教师生成的轨迹进行有监督的微调,建立工具使用行为,然后通过强化学习对其进行完善。类别感知混合奖励评估工具调用的有效性、适合任务的工具使用以及生成的视频质量。我们进一步介绍 VABench,这是一个包含 600 个提示的基准测试,涵盖程序知识、单实体和多实体身份保存、物理一致性、场景合成和多镜头时间结构。在 VABench 上,VideoGen-Agent 比其基本文本到视频生成器提高了 19.1 分,从 56.5 提高到 75.6。升级生成工具将分数进一步提升至 86.1,无需额外的智能体训练。在 84.3% 的比较中,人类评估者更喜欢升级的配置,而不是最强的独立基线。这些结果支持在视频生成任务中使用学习工具,并表明经过训练的智能体可以从生成工具的后续进步中受益。