论文

具有超线性优势塑造的文本到图像模型的力量增强 后训练

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

模型训练强化学习

摘要

最近,基于强化学习的 后训练 方法,特别关注组相对策略优化 (GRPO),已成为进一步推进文本到图像 (T2I) 模型的稳健范例。然而,这些方法通常容易出现 奖励作弊,其中模型利用不完美奖励函数中的偏差,而不是产生真正的性能增益。在这项工作中,我们发现标准化可能会导致错误校准,并且直接删除即时水平标准差项会产生最佳策略上升方向,该方向与优势呈线性关系,但仍然限制了真实信号与噪声的分离。为了缓解上述问题,我们通过从信息几何角度重新审视功能更新,提出了超线性优势塑造(SLAS)。通过利用依赖优势的权重扩展 Fisher-Rao 信息度量,SLAS 引入了重塑局部策略空间的非线性几何结构。这种设计放松了高优势方向的约束,以放大信息更新,同时收紧低优势方向的约束,以抑制虚幻的梯度。此外,应用批次级归一化来稳定不同奖励规模下的训练。广泛的评估表明,SLAS 在多个主干网和基准上始终超越 DanceGRPO 基线。特别是,它产生了更快的训练动态,改进了 GenEval 和 UniGenBench++ 的域外性能,增强了模型扩展的鲁棒性,同时减轻了 奖励作弊 的影响,并在各代中保持语义和组合保真度。