论文
VideoAgent:用于视频理解和编辑的一体化框架
VideoAgent: All-in-One Framework for Video Understanding and Editing
摘要
视频编辑在数字媒体创作中已变得至关重要,但现有的自动化系统仅限于短片段处理和特定领域的任务。他们面临两个关键的限制:i)无法处理多样化的视频理解和编辑操作,ii)缺乏对连贯叙事创作的长视频理解。我们提出了 VideoAgent,这是一种一体化代理框架,通过两项关键创新来应对这些挑战。首先,我们使用镜头规划代理开发自动视频镜头创建,以实现连贯的叙述和跨模式检索以对齐视觉内容。其次,我们设计了一个集成了三十多个专业编辑代理的多代理编排框架。意图解析过滤相关工具,而文本梯度图优化组装复杂的编辑管道。对我们新提出的 VideoEdit 基准和公共数据集进行的大量实验证明了 VideoAgent 相对于现有多模式 LLM 和代理系统的优越性。 VideoAgent 实现了 87-95% 的编排成功率,同时将 API 成本降低了 60%。对六个视频类别的人工评估显示,VideoAgent 生成的专业品质内容接近人类水平,其评分仅比人工创建的视频低 4%。我们在 https://github.com/HKUDS/VideoAgent 发布了我们的代码。