论文
MiVE:用于参考引导视频编辑的多尺度视觉语言功能
MiVE: Multiscale Vision-language features for reference-guided video Editing
摘要
参考引导视频编辑将源视频、文本指令和参考图像作为输入,要求模型忠实地应用指示的编辑,同时保留原始运动和未编辑的内容。现有方法分为两种范式,每种范式都有固有的局限性:解耦编码器在独立处理指令和视觉内容时会遇到模态差距,而统一视觉语言编码器仅依赖最终层表示就会丢失细粒度的空间细节。我们观察到 VLM 层对补充信息进行分层编码——早期层捕获精确编辑所必需的局部空间细节,而更深的层编码全局语义以实现指令理解。基于这一见解,我们提出了 MiVE(用于参考引导视频编辑的多尺度视觉语言特征),这是一个将 VLM 重新用作多尺度特征提取器的框架。 MiVE 从 Qwen3-VL 中提取分层特征,并将其集成到统一的自注意力扩散 Transformer 中,消除了交叉注意力设计中固有的模态不匹配。实验表明,MiVE 在人类偏好中排名最高,实现了最先进的性能,优于学术方法和商业系统。