论文
对镜头的思考:通过代理推理进行一致的多镜头视频编辑
Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
摘要
虽然生成式人工智能具有显着先进的视频编辑功能,但现有方法主要关注单镜头或短视频剪辑。使用多个指令编辑长视频仍然是一个艰巨的挑战。幼稚的分块策略,例如固定持续时间的分割,通常会导致实体碎片、严重的编辑幻觉和时间连续性被破坏。为了弥补这一差距,我们引入了多指令多镜头长视频编辑(MMLVE)任务,该任务围绕三个核心目标构建:交叉镜头编辑一致性(CSEC)、多指令解耦(MID)和时空结构零破坏(ZDSS)。为了解决这三个独特的挑战,我们引入了一个代理编辑框架,该框架利用 大语言模型 (LLM) 和视觉语言模型 (VLM) 的协同作用来实现镜头级视频解耦和精确的指令解析。此外,为了全面评估这项任务,我们构建了 MMLVE-Bench,这是一个以 MMLVE 为中心的数据集,其特点是复杂的现实世界时空动态、高密度异构指令和稀疏随机实体分布。进一步利用三个以 MMLVE 为中心的评估指标来评估编辑结果的质量。大量实验表明,我们的 MMLVE-Agent 优于现有的闭源 SOTA 方法(例如 Seedance 2.0),成功消除了编辑幻觉,保持了跨镜头编辑一致性,并实现了无缝时空过渡。