减少虚假信用传播:基于Rubric的强化学习的概率图形奖励聚合
Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning
摘要
基于评分标准的奖励越来越多地用于开放式语言模型 后训练,但标准级别的分数通常被聚合为独立的实用程序。这种扁平化忽略了标准指定的先决条件和标准之间的激活关系,即使在不存在许可条件的情况下也可以计算奖励或惩罚。我们将这种结构性奖励聚合失败称为 \textbf{虚假信用传播} (FCP)。为了解决这个限制,我们提出了 \ourname (\textbf{G}raphical \textbf{E}vent \textbf{A}ggregation for \textbf{R}ubricrewards),这是一个用于依赖感知的 rubric 聚合的概率图形框架。 \ourname 将每个标准结果建模为类型化标题图中的潜在伯努利事件,将软抑制从不受支持的父事件传播到其子事件,并将生成的事件概率聚合为标准化的预期有符号效用。这会产生线性时间奖励计算,可以将其插入到标准的基于 rubric 的 RL 管道中,而无需更改外部优化算法。在具有两个策略主干的 HealthBench、WritingBench 和 PLAwBench 上进行的实验表明,我们的名字相对于扁平聚合和确定性门控持续改进,相对于扁平聚合实现了高达 15.5% 的相对增益。 FCP 诊断进一步表明,相对于平面聚合,\ourname 将泄漏减少了 96.5\%,同时比确定性门控保留了更多许可的下游实用程序。我们的代码可在 https://github.com/LvCan926/GEAR 上公开获取。