论文
DTG-Restore:无需训练改善生成视频的结构与稳定性
DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution
摘要
视频扩散模型的最新进展已经实现了显着的生成保真度,但利用这些先验进行恢复仍然受到标准无分类器指导中条件分支和无条件分支之间的强耦合的限制。我们引入了 无需训练 框架,该框架通过在扩散时间步上解耦这些信号来增强失真和低分辨率视频。我们提出的解耦时间指导(DTG)以更低噪声的扩散时间步评估无条件分支,提供先行预测,在保留几何形状的同时抑制扭曲内容的复制。这种时间偏差在整个采样过程中进行退火,使模型能够从结构校正过渡到细节细化,而无需重新训练。我们的方法以即插即用的方式与任何现成的恢复模块相结合,提高了感知一致性,并恢复了人工智能生成的视频和现实世界视频中的合理结构。为了便于评估,我们策划了 GenWarp480,这是一个由不同文本到视频模型合成的 4,400 个失真 480p 视频的基准。 GenWarp480 专注于典型的生成退化,例如扭曲的面部、身体错位和空间伪影,为评估生成错误的稳健性提供了专门构建的测试平台。大量实验表明,我们的方法在没有任何 模型训练 的情况下实现了结构保真度和时间稳定性的显着改进。