论文

Goku:百万级通用数据集和基于指令的视频编辑基准

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

模型评测基准与评测资源

摘要

现有的基于指令的视频编辑数据集通常侧重于单任务外观编辑,无法满足现实场景的复杂创意需求。为了弥补这一差距,我们推出了 Goku,这是一个包含 200 万个高质量、指令对齐视频编辑对的大型数据集,它是第一个将任务边界从基本外观编辑扩展到多任务和结构操作(例如,精确控制主体运动)的数据集。为了解决这些复杂任务中固有的数据合成挑战,我们设计了一个高效的数据合成管道,将复杂的编辑分解为可控的子问题,并引入渐进式过滤系统,以确保整个过程中的数据可靠性。此外,我们探索了 Goku 上的最佳网络结构,并提出了 Goku-Edit。为了深入理解复杂的编辑指令,Goku-Edit 利用 MLLM 作为文本编码器,并采用解耦的双分支设计:专用的掩模分支处理结构控制,释放主分支进行外观渲染。还提出了综合视频编辑基准 Goku-Bench,其中包含 1,000 个经过人工验证的测试用例和 7 个新颖的特定于编辑的指标。在 Goku-Bench 上进行评估,Goku-Edit 在指令遵循方面比其他开源模型提高了 8% 以上。