论文

您的数据流形实际上是一个奖励模型:用于文本到视频生成的 Shell-LCC

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

模型训练奖励建模与过程监督

摘要

最近的文本到视频(T2V)扩散模型严重依赖辅助奖励信号(例如,通过奖励模型或 DPO)来使生成的内容与人类美学保持一致并提高真实感。然而,这些信号会产生大量的计算开销,需要昂贵的人工注释,并且通常对细粒度局部细节的改进有限。在本文中,我们认为您的数据流形实际上是一个奖励模型。通过对高质量监督 微调 (SFT) 数据的流形结构进行显式建模,并鼓励视频潜伏位于该流形上,我们得到了密集、可微分且几乎无成本的奖励信号,可显着提高视频质量,特别是在减轻底层失真方面。我们的建模建立在局部坐标编码(LCC)的基础上,它捕获了流形的“骨架”。然而,直接应用 LCC 会受到均值回归的影响,将潜在变量拉向几何平均值并丢失高频细节。因此,我们将其扩展到壳局部坐标编码(Shell-LCC),它将流形“表面”建模为各向同性壳,以与真实的高密度区域对齐。实验表明,我们的方法提高了真实感,增强了高频细节,减少了过度平滑伪影,并减轻了运动模糊。