论文

iTryOn:通过空间语义指导掌握交互式视频虚拟试戴

iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance

应用与实践内容创作

摘要

视频虚拟试穿 (VVT) 旨在将视频中某人身上的衣服无缝替换为新衣服。虽然现有方法在保持时间一致性方面取得了重大进展,但它们主要局限于模型仅展示服装的非交互式场景。这种限制忽略了现实世界服装展示的一个重要方面:主动的人与服装互动。为了弥补这一差距,我们引入并正式确定了一项新的具有挑战性的任务:交互式视频虚拟试穿(交互式 VVT),其中视频中的主体积极地与他们的衣服互动。该任务引入了简单纹理保留之外的独特挑战,包括:(1)解决标准姿势信息中交互的语义模糊性,以及(2)从交互时刻稀疏且简短的视频中学习复杂的服装变形。为了应对这些挑战,我们提出了 iTryOn,这是一种基于大规模视频传播 Transformer 的新颖框架。 iTryOn首创了多级交互注入机制来指导复杂动态的生成。在空间层面,我们引入了与服装无关的 3D 手,为精确的手与服装接触提供细粒度的指导,有效解决空间模糊性。在语义层面,iTryOn 利用全局字幕来实现整体上下文,并利用带时间戳的动作字幕来实现本地化交互,并通过我们新颖的动作感知旋转位置嵌入 (A-RoPE) 进行同步。大量实验表明,iTryOn不仅在传统VVT基准测试中实现了最先进的性能,而且在新的交互设置中建立了领先优势,标志着向更加动态和可控的虚拟试穿体验迈出了重要一步。