论文
FashionChameleon:迈向实时交互式人体服装视频定制
FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization
摘要
以人为本的视频定制,特别是在服装层面,已显示出巨大的商业价值。然而,现有方法无法支持低延迟和交互式服装控制,而这对于电子商务和内容创建等应用至关重要。本文研究了如何实现交互式多服装视频定制,同时仅使用单服装视频数据保持运动连贯性。我们推出了 FashionChameleon,这是一个用于自回归视频生成中的人类服装定制的实时交互式框架,用户可以在生成过程中交互式地切换服装。 FashionChameleon 包含三个关键技术:(i)我们不是在多服装视频数据上进行训练,而是在单个参考服装对上训练具有上下文学习功能的教师模型。通过保留图像到视频的训练范例,同时强制参考图像和服装图像之间不匹配,鼓励模型在单件服装切换期间隐式地保持一致性。 (ii) 为了在生成过程中实现一致性和效率,我们引入了具有上下文学习功能的 Streaming 蒸馏,它通过上下文内教师强制对模型进行微调,并通过梯度重新加权分布匹配 蒸馏 来提高外推一致性。 (iii) 为了扩展交互式多服装视频定制的模型,我们提出了 无需训练 KV 缓存重新调度,其中包括服装 KV 刷新、历史 KV 撤回和参考 KV 解开,以实现服装切换,同时保持运动连贯性。我们的 FashionChameleon 独特地支持交互式定制和一致的长视频外推,同时在单个 GPU 上实现 23.8 FPS 的实时生成,比现有基准快 30-180 美元\倍$。