论文

流模型的嵌入扰动探索偏好优化

Embedding-perturbed Exploration Preference Optimization for Flow Models

模型训练强化学习

摘要

最近的进展已将强化学习(RL)确立为使生成模型与人类意图保持一致的关键范式。然而,基于组的优化框架(例如 GRPO)面临着一个关键的限制:组内方差的快速衰减。随着组内样本之间的独特性减弱,方差趋近于零。这消除了优化所需的学习信号,导致过程不稳定并迫使策略过早停滞或 奖励作弊。现有的策略,例如改变初始噪声或增加组规模,通常无法解决这个基本问题,导致训练不稳定或收益递减。为了克服这些挑战,我们提出了 $\textbf{Embedding-perturbed Exploration Preference Optimization (}E^2\textbf{PO)}$,这是一种通过嵌入级扰动维持优化的新颖框架。我们的方法在样本组内引入结构化的嵌入级扰动,保证稳健的方差,从而在整个训练过程中保留判别信号。大量的实验表明,我们的方法明显优于最先进的基线,实现了与人类偏好更忠实的一致。