论文

TAMF-VTON:通过高保真图像合成进行纹理感知无掩模虚拟试戴

TAMF-VTON: Texture-Aware Mask-Free Virtual Try-On via High-Fidelity Image Synthesis

应用与实践内容创作

摘要

最近基于扩散的虚拟试穿(VTON)方法仍然受到其对分割掩模的依赖、细粒度纹理的保留不足以及对任意多服装组合的有限支持的限制。因此,现有方法在现实世界的电子商务部署中仍然面临重大挑战。我们提出了 TAMF-VTON,一种纹理感知、无掩模框架,可在实际无约束条件下实现高保真图像合成。我们的方法在推理时不需要人工解析或修复掩模,并且支持不同的服装款式、类别和数量,从而能够同时传输多个项目,同时保留身体结构和复杂的纹理细节。这是通过具有三个关键组件的统一生成管道来实现的:(1) 轻量级专家混合 (MoE) 适应方案,可在不影响基本模型的一般编辑功能的情况下实现高效的 微调; (2)频域监督机制,显式优化高频频谱一致性以保留高保真纹理; (3) 强大的数据管理管道,采用自适应修复策略来模拟逆 VTON 过程,以生成高质量的训练对。大量的实验表明,我们的方法在定量指标和感知质量方面都优于最先进的方法。该模型针对效率进行了优化,在具有 INT4 量化的 NVIDIA RTX 4090 上,每张图像在 15 秒内完成推理。通过将无掩模操作、灵活的多服装组合、忠实的纹理保存以及对消费类硬件的高效推理相结合,TAMF-VTON 展示了一种商业上可行的解决方案,可在现实世界的数字时尚场景中进行可扩展部署。该项目可在 https://www.style3d.ai/ai-photoshoot/virtual-clothing-try-on 上获取。