论文

当策略熵约束失败时:通过感知熵保持基于流的 RLHF 的多样性

When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

模型训练强化学习

摘要

RLHF 广泛用于将流匹配文本到图像模型与人类偏好对齐,但在 微调 之后经常导致严重的多样性崩溃。在强化学习中,多样性通常被认为与策略熵相关,从而激发熵正则化。然而,我们表明这种直觉在流动模型中被打破:即使感知多样性崩溃,政策熵仍然保持不变。我们从理论上和经验上解释了这种不匹配:恒定熵来自固定的、预定义的噪声调度,而多样性崩溃是由政策梯度的模式寻求性质驱动的。因此,政策熵无法阻止模型收敛到感知空间中狭窄的高回报区域。为此,我们引入感知熵,它捕获感知空间中的多样性并保持标准熵的属性。基于这一见解,我们提出了两种熵正则化策略,感知熵约束和生成空间感知约束,以保持感知多样性并提高质量。跨两个基本模型、神经和基于规则的奖励以及三个感知空间的实验证明了质量多样性权衡中的一致收益; PEC 取得了 0.734 的最佳总分(相对于基线的 0.366); PEC 的互补设置进一步达到 0.989 的多样性平均值(相对于基线的 0.047)。我们的项目页面(https://xiaofeng-tan.github.io/projects/PEC)是公开的。