论文

TIDE:用于统一视频编辑和生成的任务隔离扩散

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

模型架构Transformer

摘要

Diffusion Transformer 的最新进展推动了视频生成和编辑的快速进步,但这些功能仍然由单独的特定于任务的模型处理。构建支持不同视频任务的统一框架仍然是一个开放的挑战:现有的统一尝试要么需要专用的辅助编码器,要么缺乏区分异构条件标记的明确机制,当视觉条件的数量和类型因任务而异时,就会陷入困境。我们提出了 TIDE,一个集成了基于指令的编辑、参考引导编辑和多参考生成的统一框架。其核心是,我们引入了每个词元任务嵌入,为每个输入词元分配一个特定于任务的标识符,使模型能够显式消除目标、源和引用词元的歧义。为了同时捕获高级语义理解和细粒度结构保真度,我们设计了一种双路径调节方案,将视觉语言模型与互补信号的 VAE 潜在路径耦合起来。我们进一步设计了一种多任务渐进训练策略,逐步引入复杂性不断增加的任务,有效协调不同的目标,并实现跨异构任务分布的平滑泛化。对多个视频编辑和生成基准的大量实验表明,TIDE 在所有评估的任务中都实现了最先进的性能。我们的项目页面位于 https://LittleWork123.github.io/tide。