论文

个性化对齐中的奖励模型选择危机

The Reward Model Selection Crisis in Personalized Alignment

模型评测评测方法与指标

摘要

基于偏好数据的个性化对齐主要关注提高奖励模型(RM)准确率,并隐含认为更好的偏好排序会带来更好的个性化行为。但部署时的计算约束往往要求使用奖励引导解码(RGD)进行推理时适配,而非为每个用户微调策略,因此奖励模型不仅要正确排序偏好,还要有效指导Token级生成。本文指出,标准RM准确率不足以作为部署选型标准。作者在三个数据集上系统评估,提出策略准确率,衡量RGD评分函数区分偏好与非偏好回答的能力;RM准确率与该能力仅弱相关,Kendall相关系数为0.08—0.31。作者还提出带真实用户续写答案的个性化对齐基准Pref-LaMP,以直接评估行为,避免循环使用奖励指标。实验中,RM准确率相差20个百分点的方法生成质量几乎相同,即使区分能力较高,也未必生成符合偏好的行为。对大于3B参数的模型,简单上下文学习(ICL)优于全部受测奖励引导方法;在7B规模,相比最佳奖励方法的ROUGE-1高3—5分。结果表明,被优化的代理指标未必预测部署表现,也未必能在部署约束下将偏好转为实际行为适配。