论文

ReNFT:通过内部概率质量重新校准修复奖励 后训练 中的模式崩溃

ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration

模型训练偏好优化

摘要

扩散生成器的奖励 后训练 不可避免地将概率质量集中在一些有利于奖励的模式上,这种模式崩溃会消除提示内的多样性。现有的缓解崩溃的方法依赖于外部信号或接口、通过感知目标增加奖励、调整参考正则化或修改文本编码器,但没有一种方法可以修复已经崩溃的适配器,同时保留所获得的奖励。我们观察到,在线 后训练 主要重新分配从预训练继承的能力的概率质量,而不是学习新的视觉内容。因此,崩溃是抑制,而不是删除,并且可以从生成器内部逆转。我们提出 ReNFT,它通过内部概率质量重新校准来修复高回报、低多样性的适配器。无条件探测首先优先考虑“反中心”提示,其中与提示无关的偏见最容易暴露。然后,两条政策主导的混合路线从相同的提示和初始噪声中生成匹配的反事实建议,一条探索冻结的基础方向以寻找受抑制的替代方案,另一条则暴露训练后的无条件趋势。自适应翻转防护的奖励排名分配拉动和推动角色,联合配对 NFT 更新实现修复。在 PickScore 和 GenEval 上,ReNFT 保留了 NFT 98.9% 和 99.0% 的奖励,同时将 DreamSim-Div 分别提高了 58.8% 和 55.0%,为外部干预提供了补充替代方案。