技术实践
京东零售迭代虚拟试穿模型并扩大服饰覆盖
概述
京东零售自 2023 年启动虚拟试穿项目,历经四代框架:第一代以 U-Net 作扩散模型主体、Reference Net 注入服饰信息。第二代把主体从 U-Net 升级为 DiT 并用 ViT+VAE 表示服饰特征(借 VAE 重构目标提升 logo 等细节一致性,且在该框架下可剥离文本模块),同时验证扩散模型 Scaling Law(1B→3B→10B→20B,融入 VL 框架后升至 30B 乃至更大,效果肉眼可见提升)。 第三代从图像试穿升级到视频试穿,把视频解析为带 mask 帧序列与类 OpenPose 姿态帧序列分别编码建模,由 MM-DiT 去噪生成。第四代彻底摒弃 Mask 模块改为 Mask Free 通用架构,参考图表征由纯视觉升级为引入视觉语言模型的多模态统一表征,改善身份、姿态、细节与配饰保留并天然兼容套装与配饰同步试穿。 产品侧当前处于小流量测试阶段,已覆盖超百万服饰 SKU、70 多个服饰类目、合作头部服饰品牌超 500 家,实验阶段用户量突破 100 万。线上形态包括商详主图试穿入口(实验阶段保守设置)、同款不同色一键换色试穿与同店铺上下装搭配试穿,并加入“真实照片上传+虚拟数字人”双轨降门槛(超过半数用户无法上传合规照片)。