论文

VideoX-Qwen:以数据为中心的指令式视频编辑

VideoX-Qwen: Data-Centric Instruction-Based Video Editing

模型训练合成数据

摘要

通用视频编辑的进步依赖于构建大规模成对监督数据,以及有效地将视频生成骨干适配到指令驱动的编辑。与视频生成不同,视频编辑必须在执行所需变换的同时,保留无关主体、场景结构、运动与时间连续性。我们提出VideoX-Qwen,一个面向通用指令式视频编辑的一体化数据构建与模型训练框架。我们可扩展的生产流水线把专门的生成与理解模型组织为针对添加、删除、替换和属性编辑的互补路线,随后进行质量筛选与指令增强。它产出超过120万条有方向性的视频编辑记录,其中每个主要任务组各超过40万条,自动通过率为89%。所得语料通过统一的“源-指令-目标”接口,对常见编辑操作提供了广泛而结构化的覆盖。我们进一步开发了统一的Qwen-Wan编辑器,将多模态语义条件与稠密的源视频隐变量引导相结合。渐进式图像-视频训练策略对齐了多模态指令接口,使视频生成器适配源条件编辑,并用精选的高分辨率数据细化输出质量。在与UniVideo和Kling O1的100例对比中,VideoX-Qwen在所报告的11项指标中有9项取得最佳均值,包括指令遵循、编辑质量、内容保持、结构与感知相似度以及视频分布质量。大规模数据生产系统与统一训练框架共同为更强的指令驱动视频编辑提供了实用基础。

VideoX-Qwen:以数据为中心的指令式视频编辑:论文配图
图 4:主体替换与颜色编辑的定性比较。上:将熊替换为马。中:将黑天鹅改为粉色。下:将大象替换为长颈鹿。