论文
对齐推理:用于视频编辑的扩散 Transformer 中的隐式推理
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
摘要
基于指令的视频编辑需要根据自然语言指令转换源视频,同时保留不相关的内容并保持时间连贯性。我们认为,现有的 Diffusion Transformer (DiT) 编辑由于两个结构性原因而难以完成这项任务。首先,条件信号被无差别地馈送到所有 Transformer 块中,迫使单个词元流对全局编辑意图和细粒度视觉证据进行编码。其次,控制编辑的交叉注意模式仅通过像素级重建进行间接监督,从而使模型的内部推理过程受到约束。为了解决这两个限制,我们提出了 RVEDiT,这是一个围绕两个互补组件构建的隐式推理视频编辑 DiT 框架。第一个是粒度路由词元调节,引入了从多模式 LLM 中提取的可学习编辑词元,并将它们路由到浅层块,同时为更深的块保留本机视觉和文本词元,从而在主干内引入从粗到细的编辑过程。第二种是参考锚定注意力对齐,在训练过程中采用参数共享参考分支,最大化编辑和参考分支的注意力特征之间的互信息,规范模型的内部推理,而不会产生任何额外的推理成本。基于标准指令的视频编辑基准的实验表明,RVEDiT 始终优于最先进的基准,尤其是在本地化和合成编辑方面取得了显着的进步。