论文
EnGRICH:通过人类的批评增强生成奖励模型
EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans
摘要
生成奖励模型 (GRM) 对于LLM优化非常重要。与标量奖励模型不同,GRM 会在偏好判断的同时生成自然语言批评,从而提供更细粒度的评估信号。它们的有效性在很大程度上取决于批评的可靠性。然而,现有的 GRM 训练通常使用最终偏好正确性作为结果监督。由于偏好结果空间受到高度限制,不可靠的批评仍然可以产生正确的结果,从而得到强化。最近的工作利用人类批评来进行过程监督,但这种批评很少,而且往往被简化为标量奖励,导致其细粒度的评估信息未得到充分利用。我们认为,从人类批评中学到的评估标准可以推广到更广泛的仅结果偏好数据。为此,我们提出 EnGRICH,一个 GRM 训练框架,它将 GRM 与从一小部分人类评论中学习到的训练时间 MetaCritic 配对。 MetaCritic 构建针对特定响应的评分标准,并使用它们来评估证据覆盖范围和所生成评论的正确性。由此产生的信号既提供了细粒度信用分配的过程奖励,也提供了探索更好批评的结构化指导。在 GRM 训练期间,MetaCritic 进一步优化,将以人为本的评估标准推广到仅结果数据。由此推断,经过训练的 GRM 是独立运行的。七个奖励模型基准的实验表明,EnGRICH 在竞争基准上持续改进,同时进一步分析验证了其核心机制的有效性。
