论文
VISTA:三重态监督视频风格转移与扩散 Transformer
VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers
摘要
视频风格迁移旨在以目标艺术风格渲染视频,同时保留内容、结构和动作。虽然图像风格化发展迅速,但由于时间不一致,视频风格化仍然具有挑战性。大多数现有方法对帧或关键帧进行风格化,并通过启发式时间传播来强制一致性,这在遮挡、解除遮挡和长期运动的情况下很脆弱,导致漂移和闪烁伪影。我们认为,根本瓶颈在于缺乏大规模三元组数据和联合建模和解开风格、内容和运动的有原则的训练范式。为了解决这个问题,我们引入了 VISTA-1000,一个包含 1,000 种风格和运动对齐的风格参考、干净视频和风格化视频三元组的合成数据集,并提出了一种基于扩散 Transformer 的上下文视频风格传输框架,具有轻量级风格适配器以实现鲁棒风格提取。大量实验证明了 SOTA 在风格保真度、时间一致性和内容保存方面的性能。