论文

从视频剪辑到创作轨迹:Sora100K AI原生视频创作

From Video Clips to Creation Trajectory: Sora100K for AI-Native Video Creation

模型训练模型评测合成数据基准与评测资源

摘要

AI-Native 视频创作正在从孤立的视频剪辑转向迭代视频创作工作流程。然而,现有数据集主要仍然是视频剪辑,将视频生成和编辑表示为单独的任务,而不是视频创建工作流程的连接阶段。在本文中,我们介绍了 Sora100K,这是一个将 AI-Native 视频创建工作流程表示为结构化视频创建轨迹的数据集。具体来说,我们首先识别视频创作轨迹,并根据其结构角色将其分解为三个子集:文本到视频生成记录作为根,单轮视频编辑记录作为编辑边,多轮视频编辑记录作为完整轨迹。然后,我们使用 VLM 为生成根分配语义注释,为编辑边分配编辑操作注释。严格的构建流程进一步重建源到编辑的沿袭、编辑顺序和中间视频状态,同时确保数据质量。最后,我们对LTX-2模型进行轻量级适配,以评估Sora100K的监督价值。这 结果显示视觉质量、多镜头生成和交叉镜头一致性方面有所改进,而连续回合评估表明遵循多回合编辑指令仍然具有挑战性。 Sora100K 为 AI-Native 视频创作建立了新的数据基础,超越孤立的视频剪辑,走向结构化视频创作轨迹。数据集和补充材料可在 https://huggingface.co/datasets/ysicong/Sora100K. 上公开获取