论文
ModaFlow:用于高保真虚拟试穿的模态感知流程匹配
ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On
摘要
基于图像的虚拟试穿已成为电子商务和增强现实领域的一项引人注目的任务,但现有方法很难同时保留精细的服装语义并适应大服装身体变形下的不同人体几何形状。我们推出了 ModaFlow,这是一种基于模态感知流程匹配的框架,用于高保真虚拟试穿,可实现文本描述和服装外观之间的精确对齐。与之前统一处理多模态条件的方法不同,ModaFlow 引入了模态感知引导方案:由预训练图像提示适配器提取的视觉服装嵌入提供确定性、持久的结构指导,而从服装描述生成的文本嵌入则通过具有自适应缩放和零初始化速度的无分类器引导 (CFG) 进行控制。为了进一步提高流场精度,我们提出了两种正则化损失:余弦相似性和感知流辨别,共同提高速度场的方向一致性和感知真实性。此外,掩码操作策略在训练期间在框、透明和松弛掩码之间随机采样,模拟不同的遮挡场景,并在只有框掩码可用的不配对设置下实现稳健的推理。实验表明,ModaFlow 在定性和定量评估方面均取得了最先进的结果,在配对基准上将 FID 降低了约 30%,在未配对基准上将 FID 降低了 20%。