论文

通过因果分解对 大语言模型 进行鲁棒奖励建模

Robust Reward Modeling for Large Language Models via Causal Decomposition

模型训练奖励建模与过程监督

摘要

奖励模型对于调整 大语言模型 至关重要,但它们经常过度拟合虚假线索,例如响应长度和过于令人愉快的语气。大多数先前的工作通过惩罚或控制特定的工件来直接削弱这些线索,但它并没有明确鼓励模型将偏好置于提示的意图中。我们学习一个解码器,将候选答案映射到输入的潜在意图嵌入。重建误差用作正则化奖励 模型训练 的信号。我们提供的理论证据表明,该信号强调与提示相关的信息,同时抑制与提示无关的快捷方式。在数学、有用性和安全性基准方面,解码器以 0.877 的准确度选择了更短、更少阿谀奉承的候选人。将此信号合并到 Gemma-2-2B-it 和 Gemma-2-9B-it 中的 RM 训练中,将 RewardBench 准确度从 0.832 提高到 0.868。对于 Best-of-N 选择,我们的框架提高了长度控制的获胜率,同时产生较短的输出,并且在受控重写测试中对延长和轻微偏离主题漂移保持鲁棒性。