论文

焦点奖励:基于标题的奖励下的平衡强化学习

Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

模型训练奖励建模与过程监督

摘要

LLM 中的开放式生成通常需要多维度的评价标准来充分评估质量并指导强化学习的改进。然而,这种训练范式固有的一个关键困境是不同维度的奖励极化不平衡。在这个瓶颈下,即使LLM在训练后获得了较高的奖励,但在某些维度上仍然可能表现出严重的缺陷,导致用户体验的直接恶化。为了解决这个问题,我们提出了焦点奖励(Focal Reward),这是一个新的目标,可以在基于规则的奖励下自动平衡强化学习的训练。具体来说,我们首先利用逆奖励投影机制来估计标题中每个标准的饱和度,这构成了校准奖励方向的基础。然后,为每个标准设计一个自动重新加权系数的最终目标,以实现细粒度的平衡。跨三个模型尺度和六个基准的广泛实验表明,我们的焦点奖励方法在所有 18 个模型基准比较中优于最强的静态聚合基线。轨迹采样、机制和消融分析进一步表明,这些收益来自于在线、饱和感知的重新分配,这些指标仍有改进的空间。