论文
TryOnReward:学习焦点一致性以进行虚拟试穿的强化微调
TryOnReward: Learning Foveated Consistency for Reinforcement Fine-Tuning of Virtual Try-On
摘要
虚拟试穿 (VTON) 旨在为人穿上参考服装,产生符合人类喜好的视觉上合理的结果。将这种以偏好为导向的目标转变为可操作的目标依赖于符合人类品味的评分函数。然而,经典的保真度指标与人类判断的相关性较弱,并且通用 VLM 无法提供试穿质量评估所需的区分粒度,而试穿质量评估取决于忠实保留服装和个人细节。这一缺点在强化微调(RFT)优化中进一步加剧,并导致严重的奖励作弊行为。为此,我们推出了为 VTON 量身定制的细粒度奖励模型 TryOnReward。它建立在视觉语言主干之上,采用注视点校准目标,将每个质量维度基于相关区域,以避免全局捷径学习。同时,TryOnReward 通过边缘感知监督,利用相对和绝对质量信号,联合优化成对偏好和每维度质量得分。对于模型训练和评估,我们构建了 TryOnReward-100K(一个人工注释的每维度评分数据集),以及 TryOn-Bench 和 TryOnRewardBench(两个涵盖不同真实场景的基准)。大量实验证实,TryOnReward 在人类偏好对齐方面显着优于通用判断,并且当用作 RFT 奖励函数时,它在多个基线上始终产生人类偏好的试穿结果。