论文
LiveVVT:高保真视频实时虚拟试戴
LiveVVT: High-Fidelity Video Virtual Try-On in Real Time
摘要
基于扩散的视频虚拟试穿(VVT)通过双向时空建模实现了高视觉保真度,但在实际的连续部署中,完全剪辑依赖会导致过高的延迟和计算开销。天真地强制执行因果关系会破坏预先训练的双向先验,并大大降低合成质量。我们引入了 LiveVVT,这是一种滚动流扩散框架,可在因果循环生成中保留有界双向建模。在固定大小的窗口内,LiveVVT 在有界前视下联合对多个视频块进行去噪,保留本地双向交互,同时每次迭代发出一个干净的块。在窗口之外,两个互补的记忆维持长期一致性:有界时间记忆传播最近的动态和遮挡上下文,而持久的全局外观记忆(从目标服装和正面试穿关键帧构建一次)在整个流中锚定服装细节和着装外观。我们进一步介绍了一种渐进式 蒸馏 框架,集成了双向 VVT 学习、用于因果几步适应的教师轨迹回归和协作匹配 蒸馏,它将教师分布匹配与真实视频上的滚动流匹配相结合,以使优化与循环推理保持一致。配对和不配对长序列基准测试的实验表明,与类似大小的模型相比,生成质量更高,延迟降低 26 倍,吞吐量提高 11 倍,从而实现高保真实时流式 VVT。