论文
用于视频生成的系统化后训练框架
A Systematic Post-Train Framework for Video Generation
摘要
虽然大规模视频扩散模型在生成高分辨率和语义丰富的内容方面表现出了令人印象深刻的能力,但由于即时敏感性、时间不一致和过高的推理成本等关键问题,其预训练性能与现实世界的部署要求之间仍然存在巨大差距。为了弥补这一差距,我们提出了一个全面的 后训练 框架,通过四个协同阶段系统地将预训练模型与用户意图结合起来:我们首先采用监督 微调 (SFT) 将基本模型转换为稳定的指令跟踪策略,然后是人类反馈强化学习 (RLHF) 阶段,该阶段利用专为视频传播量身定制的新颖的组相对策略优化 (GRPO) 方法来增强感知质量和时间一致性;随后,我们通过专门的语言模型集成提示增强来细化用户输入,并最终通过推理优化解决系统效率问题。这些组件共同提供了一种系统方法来提高视觉质量、时间一致性和指令遵循,同时保留在预训练期间学到的可控性。其结果是构建可扩展的 后训练 管道的实用蓝图,这些管道在实际部署中稳定、适应性强且有效。大量的实验表明,这种统一的管道有效地减少了常见的伪影,并显着提高了可控性和视觉美感,同时遵守严格的采样成本限制。