论文
5,500 小时的驾驶时间可以带您走多远?视频扩散模型的标度律分析
How Far Can 5,500 Hours of Driving Take You? A Scaling Law Analysis of Video Diffusion Models
摘要
自动驾驶的视频生成不能遵循网络规模的路线:驾驶数据的收集成本很高,受到隐私要求的约束,并且不能随意抓取,因此模型必须充分利用固定语料库。我们对根据驾驶数据从头开始训练的视频扩散模型进行了系统的标度律研究:一系列从 1M 到 9B 参数的模型,在长达 5,500 小时的驾驶中在不同曝光下进行训练。验证损失在模型大小和训练暴露方面遵循一致的幂律,回答了形成训练预算的问题:计算是否更好地用于较长的训练或较大的模型,以及是否需要更多数据。与模型大小相比,训练暴露的损失改善速度要快得多,这使得更长的训练成为在有限计算下改进固定模型的最有效方法。然而,较大的模型继续实现较低的渐近损失,因此当有足够的计算和数据可用时,计算最优缩放仍然有利于增加模型大小。在这些定律的指导下,我们训练了一个 9B 参数模型,据我们所知,这是在驾驶数据上从头开始训练的最大视频扩散模型:它为驱动视频生成设定了新的开源技术水平,如在 nuScenes 上测量的那样。我们的代码和预训练模型可在 https://github.com/valeoai/VATIX 上获取。 NATIX正在分阶段单独发布底层行车数据。