论文

DynaCF:通过动态反事实敏感性减轻奖励模型中的快捷学习

DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

模型训练奖励建模与过程监督

摘要

根据成对偏好训练的奖励模型通常利用表面的捷径线索,而不是学习真实的响应质量。我们提出了 DynaCF,一种动态重新加权框架,用于减轻奖励 模型训练 的捷径学习。与静态捷径启发法不同,DynaCF 通过应用保留语义的反事实扰动并跟踪当前模型下产生的边距变化和偏好翻转,在优化过程中在线测量捷径敏感性。在 Bradley-Terry 目标中,具有较高捷径敏感性的样本会动态降低权重,从而鼓励模型减少对表面模式的依赖,而更多地依赖与任务相关的偏好信号。大量实验表明,DynaCF 持续提高了偏好建模的鲁棒性。