论文

ThinkV2V:释放 MLLM 的推理能力,进行指令引导视频编辑

ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing

模型推理推理策略与问题分解

摘要

指令引导的视频编辑已经取得了重大进展,但现有方法主要使用多模态大语言模型 (MLLM) 作为语义编码器,因此它们在处理需要因果或语义推理的隐式编辑时通常无法满足要求。为了弥补视频编辑中的这一根本差距,我们提出了 ThinkV2V,这是一种用于复杂指令引导视频编辑的推理驱动框架,在视觉生成之前明确激活 MLLM 思维。 ThinkV2V 的核心是建立在实用的 MLLM-to DiT 架构之上,将对源视频和指令的明确思考转变为用于视频编辑的精细调节信号。此外,我们还为其配备了专门的训练和推理配方,结合渐进式课程训练(逐步培养从基础编辑到推理密集型案例的模型)和推理时间思维缩放(迭代细化候选提示并选择最可靠的提示),以便在具有挑战性的编辑场景中更好地引出推理。我们还整理了 ThinkV2V-150K 数据集,并引入 ThinkV2V-Bench 来支持具有隐式意图和因果推理的视频编辑的训练和评估。实验结果证明了 ThinkV2V 在复杂和标准编辑场景中的最先进性能,其中我们的 5B 规模 DiT 模型大大优于更大的 10B 规模基线。