论文
直接:通过分层多代理规划和意图引导编辑创建视频混搭
DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing
摘要
视频混搭创作代表了一种复杂的视频编辑范例,它重新组合现有的素材以打造引人入胜的视听体验,需要跨语义、视觉和听觉维度和多个层次进行复杂的编排。然而,现有的自动编辑框架经常忽视跨级别的多模式编排以实现专业级的流动性,从而导致脱节的序列、突然的视觉过渡和音乐错位。为了解决这个问题,我们将视频混搭创建制定为多模态一致性满意度问题(MMCSP),并提出了 DIRECT 框架。模拟专业的制作流程,我们的分层多智能体框架将挑战分解为三个级联级别:用于源感知全局结构锚定的编剧、用于实例化自适应编辑意图和指导的导演、以及用于具有细粒度优化的意图引导镜头序列编辑的编辑器。我们进一步介绍 Mashup-Bench,这是一个综合基准测试,具有针对视觉连续性和听觉对齐的定制指标。大量实验表明,DIRECT 在客观指标和人类主观评估方面均显着优于最先进的基线。项目页面和代码:https://github.com/AK-DREAM/DIRECT