论文
Vorch-Omni:视觉和声音的多任务编排
Vorch-Omni: Multi-Task Orchestration of Sight and Sound
摘要
生成视频建模的最新进展使得多样化的生成、基于参考的合成、扩展和编辑成为可能,但现有的方法通常依赖于碎片化的特定于任务的模型。通用模型必须区分异构目标、源和参考信号,以确定生成、保留或用作指导的内容,同时减少任务之间的干扰。联合视听生成通过跨模式引入不同的调节和输出配置进一步增加了这一挑战。我们提出了 Vorch-Omni,这是一个基于任意条件到任意输出公式的视听合成统一多任务框架。它灵活地将视频和音频信号视为调节输入或生成目标。 词元级 条件掩码和任务标识符区分目标、源内容和引用,而位置类型将时间上下文与独立条件分开。为了捕获语义和结构信息,Vorch-Omni 采用互补的视觉调节路径:视觉语言模型用文本指令解释采样帧,视频 VAE 将条件编码为潜在标记以进行直接指导。我们进一步构建了一个分布式数据管道来管理各种时间对齐的视听剪辑,生成结构化视听描述和元数据,并平衡异构任务分布。 Vorch-Omni 基于单个流匹配扩散 Transformer 构建,无需进行特定于任务的架构更改,支持 10 多种任务,包括文本到视频、文本到音频视频、图像和参考条件生成、时间扩展、音频驱动生成、视频转换和视听编辑。这个统一的框架为通用视听生成和操作提供了可扩展的基础。