论文

UniVVT:用于高保真视频虚拟试戴的统一端到端框架

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

应用与实践内容创作

摘要

视频虚拟试穿 (VVT) 合成一个人穿着目标服装的视频,同时保留身份、运动和场景动态。主流方法将 VVT 视为掩模调节的视频修复,并依赖于单独的模块进行人体解析、姿势估计和服装变形。这种多阶段设计使部署变得复杂,更重要的是,它允许显式几何先验中的错误不可逆地传播到生成的视频中。我们提出了 UniVVT,这是一个统一的端到端框架,它将 VVT 重新构建为语义条件视频生成,消除了推理时的掩模、姿势和扭曲模块。其核心是,基于多模态 大语言模型 构建的场景任务感知器将源视频、目标服装和任务指令联合编码为紧凑的、任务感知的潜在词元,隐式捕获要传输的内容以及传输的位置和方式。然后,轻量级语义桥将这些标记与基于扩散的视频生成器的调节空间对齐,从而实现连贯的服装传输。为了稳健地耦合异构组件,我们设计了一种三阶段渐进训练策略,包括语义对齐、联合任务适应和灵活分辨率细化。大量实验表明,UniVVT 在多个基准测试中实现了最先进的性能,验证了隐式语义指导是端到端虚拟试穿中脆弱几何预处理的简单而有效的替代方案。