论文

OmniTryOn:立即视频试穿任何东西!

OmniTryOn: Video Try-On Anything at Once!

模型架构Transformer

摘要

尽管视频虚拟试穿(VVT)取得了重大进展,但现有方法仍然表现出两个基本局限性:首先,它们仅限于单件服装传输,渲染同时多对象试穿非常不切实际;其次,它们对明确的外部先验(例如服装面具)的严重依赖不可避免地破坏了关键的物理动力学并降低了视觉质量。为了弥补这一差距,本文提出了新颖的 Try-On Anything 任务,其目标是在一次推理过程中将不同的可穿戴物体同时转移到视频中的人身上。为了支持和标准化这种范例,我们引入了 TryAny-Bench,这是一个综合基准测试,包含配对视频数据集以及定制的评估协议。此外,我们还提出了 OmniTryOn,这是一个旨在解决此任务的无外部先验生成框架。具体来说,OmniTryOn采用了首帧可穿戴缓存策略,通过初始视频帧直接为生成过程提供各种可穿戴对象。为了保持一致性,我们提出了时空一致 RoPE (STC-RoPE),它本质上建立了鲁棒的时空锚点以严格保留复杂的人体运动和背景动态。通过提出的渐进试穿(GTO)训练策略进行优化,我们的模型逐渐掌握了鲁棒的多对象合成。 TryAny-Bench 上的大量实验表明,OmniTryOn 的性能显着优于现有的专用视频虚拟试戴模型和一般视频编辑基线,为 Try-On Anything 任务建立了强大的新标准。我们的数据集、代码和模型可在 https://github.com/xcltql666/OminTryOn 获取。