论文
ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑
ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships
摘要
最近基于扩散的视频生成模型在多参考图像条件视频编辑方面取得了重大进展。然而,现有的方法仍然难以准确地协调来自多个视觉源的信息。我们发现现有方法存在严重缺陷。现有的编辑指令缺乏明确的引用关系,并且大多数多模式 大语言模型 (MLLM) 无法可靠地生成它们。为了解决这个问题,我们提出了 ReBind,这是一个系统框架,它引入了带有嵌入参考标记的语义指令作为多参考图像条件视频编辑的中间表示。我们的主要见解是在语义位置嵌入参考标记,以消除歧义并在视觉属性与其来源之间建立精确的绑定。我们开发了 ReBind-Instruct,这是一种专门的 MLLM,它通过两阶段渐进方案学习在视觉属性与其参考源之间建立显式绑定,以实现精确的参考关系。我们进一步开发了 ReBind-Edit,它可以轻量级地适应文本到视频模型,通过将视觉属性绑定到指定源来协调多个引用。大量实验表明,ReBind 在指令质量方面远远优于通用 MLLM,并在参考图像条件视频编辑的开源方法中实现了最先进的性能。我们的项目网页:https://rebind-mrv2v.github.io/。