论文
ConsistRM:通过一致性感知自训练改进生成式奖励模型
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
摘要
生成奖励模型 (GRM) 已成为一种很有前途的方法,通过提供比传统标量奖励模型更大的表示能力和灵活性,使大语言模型 (LLM) 与人类偏好保持一致。然而,GRM 面临着两个主要挑战:对昂贵的人工注释数据的依赖限制了可扩展性,并且自我训练方法经常受到奖励黑客攻击的不稳定和脆弱性的影响。为了解决这些问题,我们提出了 ConsistRM,这是一种自我训练框架,无需人工注释即可实现有效且稳定的 GRM 训练。 ConsistRM 结合了一致性感知答案奖励,可生成具有时间一致性的可靠伪标签,从而提供更稳定的模型优化。此外,引入了一致性感知批评奖励来评估多个批评之间的语义一致性,并分配细粒度和差异化的奖励。对四个基本模型的五个基准数据集进行的实验表明,ConsistRM 的性能比普通强化微调 (RFT) 平均高出 1.5%。进一步分析表明,ConsistRM 增强了输出一致性并减轻了输入顺序引起的位置偏差,凸显了一致性感知奖励在改进 GRM 方面的有效性。
