论文

RAGDiffusion++:服装生成从宏观检索到微观保真度对齐

RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation

模型训练强化学习

摘要

标准服装资产生成——从不同的现实世界背景中恢复前向平铺服装图像——拥有巨大的商业价值,但同时需要宏观拓扑准确性和微观物理保真度。尽管我们之前的工作 RAGDiffusion 通过检索增强的宏观约束有效地消除了大规模的结构幻觉,但实现工业级微观纹理真实感仍然是一个尚未解决的瓶颈。我们正式将这种限制称为高频轨迹崩溃:监督 微调 (SFT) 收敛到训练分布的条件均值,该分布以平滑的低频纹理为主,导致高频图案(例如织物编织、复杂的徽标)变得几乎不可采样。天真的应用强化学习 (RL) 后训练 进一步触发 Artifact Hacking,其中模型通过生成欺骗性棋盘噪声来利用通用奖励模型中的语义偏差。我们的主要见解是,强化学习可以从根本上重塑流模型的采样分布——在准确的奖励指导下提高高保真轨迹的概率——而对抗性正则化可以防止利用奖励盲点。实现这一原则需要三个先决条件:(i)通过27,725对高复杂度服装数据集(STGarment-Plus)和双图像流FLUX架构升级建立的固有容量; (ii)感知奖励,由新颖的属性感知奖励模型(Garment-RM)提供,通过细粒度对比学习在 500K 图像上进行训练,实现了 84.67% 的人类偏好准确度; (iii) 黑客预防,由我们的对抗正则化 GRPO (AR-GRPO) 策略实施,该策略将动态鉴别器集成到 RL 采样轨迹中,以惩罚伪影,同时丰富真实的高频细节。