论文

Oxygen-TryOn:适用于任何单品虚拟试穿的时尚本土基础模型

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

应用与实践内容创作

摘要

我们推出了 Oxygen-TryOn,这是一个用于任何物品虚拟试穿的统一基础模型。 Oxygen-TryOn 不是重新利用通用图像编辑器,而是原生时尚,通过专用数据引擎和特定试穿训练来构建试穿。给定一个或多个参考商品(干净的产品照片或野外穿着照片)和单个目标主题图像,它可以合成几乎任何时尚类别中穿着该商品的​​主题的逼真图像。先前的系统在工作室环境中处理单一服装类别,而最近的多参考方法仍然以服装为中心;相比之下,Oxygen-TryOn 支持多种项目和场景,包括全身和半身视图、可变数量的参考以及自由的多项目组合,同时忠实地保留受试者身份和项目外观。我们不是基于掩模的修复,而是将试穿重新制定为多参考、理解驱动的生成任务。我们构建了一个数据引擎,可以大规模收集、制造、注释和过滤高质量的试穿数据,并设计了持续 预训练 (CPT)、监督 微调 (SFT) 和强化学习 (RL) 的三阶段配方。强化学习阶段使用混合奖励,将内部试穿奖励模型与专有的、标准引导的通用模型相结合,共同监督细粒度的一致性和指令级质量。它还遵循同一通道中的一般编辑指令(例如,姿势更改)。在公共基准和我们内部的 Oxygen-TryOn Bench 上,它在单件试穿上实现了最先进的一致性和真实性,并在多件试穿上处于领先地位,匹配或超越了领先的专有系统(Nano Banana Pro、GPT-Image-2、Seedream5 Lite)和开源模型(FLUX.2)。