论文

超越高质量数据:通过时间步选择性训练解决运动视觉质量困境

Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training

模型训练合成数据

摘要

视频生成模型的最新进展取得了令人印象深刻的成果。然而,这些模型严重依赖于结合高视觉质量和高运动质量的高质量数据的使用。在本文中,我们确定了视频数据管理中的一个关键挑战:运动视觉质量困境。我们发现视觉质量和运动强度本质上表现出负相关性,因此很难获得在这两个方面都表现出色的高质量数据。为了应对这一挑战,我们首先检查视频扩散模型的分层学习动态,并对质量下降的样本进行基于梯度的分析。我们发现质量不平衡的数据可以在适当的时间步产生类似于高质量数据的梯度。在此基础上,我们在训练过程中引入了时间步选择的新概念。我们提出了时间步感知质量解耦(TQD),它修改数据采样分布以更好地匹配模型的学习过程。对于某些类型的数据,对于运动丰富的数据,采样分布偏向于较高的时间步长,而高视觉质量数据更有可能在较低的时间步长期间采样。通过大量的实验,我们证明 TQD 能够专门对分离的不平衡数据进行训练,从而以更好的数据实现超越传统训练的性能,挑战了视频生成中完美数据的必要性。此外,我们的方法在高质量数据上进行训练时还可以提高模型性能,展示其在不同数据场景中的有效性。