ODRPO:稳健政策优化的离散奖励的序数分解
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
摘要
大语言模型 (LLM) 的对齐利用人工智能反馈强化学习 (RLAIF) 来处理不可验证的领域,例如长格式问答和开放式指令跟随。这些领域通常依赖于基于 LLM 的自动评分器来提供细粒度、多层离散奖励(例如,1-10 个评分标准),由于即时敏感性和采样随机性,这些奖励本质上是随机的。我们凭经验验证了自动评分器的随机性,它可以传播和破坏 GRPO 和 MaxRL 等标准优势估计器,因为嘈杂的奖励样本可能会扭曲归一化统计数据并降低全局学习信号。根据经验,采样更多奖励并进行多数投票可能会减少噪音并提高性能,但这种方法的计算成本很高。为了解决这个瓶颈,我们引入了 $\textbf{O}$rdinal $\textbf{D}$ecomposition for $\textbf{R}$obust $\textbf{P}$olicy $\textbf{O}$ptimization ($\textbf{ODRPO}$),这是一个通过将离散奖励分解为一系列有序二元指标来在结构上隔离评估噪声的框架。通过在这些逐渐具有挑战性的成功阈值上独立计算和积累优势,ODRPO 可以防止异常值评估破坏全局更新,同时建立隐式的、方差感知的学习课程。根据经验,ODRPO 在 Qwen2.5-7B 和 Qwen3-4B 模型上实现了稳健的性能,优于基线,在 FACTS-grounding-v2 上相对改进高达 14.8%,在 Alpaca-Evals 上相对改进高达 7.5%。至关重要的是,这些收益是在训练时间开销可以忽略不计的情况下实现的,因为与标准估计器相比,ODRPO 每步不需要额外的计算。在确认其优化稳定性的理论分析的支持下,ODRPO 提供了一个可扩展且稳健的框架,用于在现代 RLAIF 的嘈杂、离散评估环境中调整模型。