论文
TripVVT:用于野外视频虚拟试戴的大规模三元组数据集和粗掩模基线
TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On
摘要
由于大规模野外三元组数据的稀缺以及掩模使用不当,视频虚拟试穿模型的性能仍然有限。在本文中,我们首先介绍 **TripVVT-10K**,这是迄今为止最大、最多样化的野外三元组数据集,提供现有视频数据集所缺乏的明确的视频级跨服装监督。在此资源的基础上,我们开发了 **TripVVT**,这是一个基于 Diffusion Transformer 的框架,用简单、稳定的人体掩模先验取代了脆弱的服装掩模,实现了可靠的背景保留,同时对现实世界的运动、遮挡和杂乱场景保持鲁棒性。为了支持综合评估,我们进一步建立了 **TripVVT-Bench**,这是一个涵盖多样化服装、复杂环境和多人场景的 100 例基准测试,指标涵盖视频质量、试穿保真度、背景一致性和时间一致性。与最先进的学术和商业系统相比,TripVVT 实现了卓越的视频质量和服装保真度,同时显着提高了对具有挑战性的野外视频的泛化能力。我们公开发布了数据集和基准测试,我们相信这为推进可控、真实且时间稳定的视频虚拟试戴奠定了坚实的基础。