论文
脾气和倾斜导致 SLOP:通过推理时间对齐缓解 奖励作弊
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
摘要
推理时间对齐技术为昂贵的强化学习提供了一种轻量级的替代方案或补充,同时随着对齐目标和奖励目标的发展而不断适应。现有的理论分析证明这些方法是从最倾向于给定奖励模型的分布中采样的近似值。我们通过引入参考模型温度调整来扩展这些技术,这导致推理时间对齐进一步推广到生成奖励模型集合,并结合为锐化对数意见池(SLOP)。为了减轻 奖励作弊 的影响,我们提出了一种用于校准 SLOP 权重参数的算法,并通过实验证明它在保持对齐性能的同时提高了鲁棒性。