论文

CoT-Edit:让CoT指导教学视频编辑

CoT-Edit: Let CoT Guide Instruction Video Editing

模型推理推理策略与问题分解

摘要

复杂场景中基于文本驱动的基于指令的视频编辑仍然具有挑战性:纯粹的文本提示通常无法捕捉精确的空间关系和物理约束,导致目标模糊和物理上难以置信的结果。为了解决这个问题,我们提出了一个计划-指南-编辑框架,它明确地连接了语义意图和空间执行。在我们的框架中,思想链 (CoT) 增强型多模态 大语言模型 (MLLM) 充当规划器,对视频和指令执行结构化推理,以得出边界框和属性丰富的编辑指令的精确序列。然后,这些空间先验指导框条件掩模生成器,将模糊的全局检索转化为局部的、上下文感知的细化,并生成能够更准确地捕获对象比例、接触关系和放置的掩模。基于这些空间和语义信号,基于扩散的编辑器集成了蒙版、丰富的指令和框架功能,以呈现在时间上保持连贯性和在空间上保持良好对齐的高保真编辑。首先以模块化方式进行训练,然后进行联合训练,我们的框架在减少数据需求的情况下实现了卓越的性能,在具有多个相似对象和物理一致的对象添加的场景中提供精确的定位,并且广泛的实验证明了与多个强大的基线方法相比最先进的性能。更多详细信息请访问:https://github.com/flying-sky999/CoT-Edit