论文
VidaForge:视频预训练数据配方的开放研究基础设施
VidaForge: Open Research Infrastructure for Video Pretraining Data Recipes
摘要
视频基础模型越来越依赖大规模预训练数据,但其背后的端到端数据管道在很大程度上仍然是封闭的,难以检查或重用。寻求了解视频数据配方如何影响模型预训练的研究人员通常需要在测试重点假设之前构建大量基础设施。我们推出了 VIDAFORGE,这是一个开放的研究基础设施,它将视频数据配方表示为从原始视频到训练数据集的可执行五阶段工作流程。此工作流程中的决策可以变化,以构建替代数据集,同时保留每个样本的生成方式。为了演示这一研究工作流程,我们在 Wan 2.1 和 V-JEPA 2.1 的早期从头开始预训练中比较了不同覆盖率和质量的数据配方。在这两个学习目标中,覆盖范围更广的配方获得了最高的下游基准分数,而基于损失的评估则有利于不同的配方。这项研究展示了 VidaForge 如何将数据配方选择与下游模型性能联系起来。我们进一步发布了 VIDAFORGE-3M,包含 314 万个场景级剪辑,总计 6,475 小时,具有用于视频数据配方研究的细粒度注释和管理信号。