论文
InstructVVT:无需辅助空间先验的指令驱动视频虚拟试戴
InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors
摘要
视频虚拟试穿是一项高度受限的编辑任务,需要精确替换目标人的服装,同时严格保留原始视频的空间结构和时间动态。现有方法严重依赖辅助手工空间先验(例如,掩模、姿势)来进行编辑控制。然而,这些先验在不受约束的现实世界视频中很容易失败,并且经常将丰富的视觉上下文压缩成不完整的结构信号。此外,标准重建目标无法完全捕捉试穿特定的人类偏好。为了应对这些挑战,我们提出了 InstructVVT,这是一种指令驱动和参考引导的视频虚拟试戴框架,基于 Diffusion Transformer (DiT),无需推理时间空间先验即可运行。我们的核心见解是通过双层参考调节方案直接从输入三元组(源视频、参考服装和指令)恢复细粒度控制。具体来说,MLLM 推断用于目标消歧和结构保留的语义编辑标记,而轻量级调节路径明确注入细粒度的视觉服装细节。最后,我们设计了特定试穿奖励,并利用 DiffusionNFT 算法使模型与人类偏好保持一致。 ViViD-S 和 TripVVT-Bench 上的大量实验表明,尽管需要较少的推理时间控制,但 InstructVVT 在服装保真度、结构保存和时间一致性方面优于最先进的开源方法。