论文
奖励模型中的偏好不稳定:通过稀疏自动编码器进行检测和缓解
Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders
摘要
大语言模型 中的偏好学习依赖奖励模型作为人类判断的代理。然而,这些模型经常表现出偏好不稳定,产生矛盾的偏好分配以响应微妙的、保留意义的输入变化。我们在三种语义保留扰动类型下分析了表示级别的这种不稳定性:释义、模式注入和后门触发器。我们将这种不稳定性归因于过度依赖预测但脆弱的特征,我们将其称为不稳定特征,并通过稀疏自动编码器(SAE)将它们隔离在稀疏的潜在空间中,其中良性和扰动的输入激活明显可分离的模式。基于这种可分离性,我们提出了两种基于 SAE 的不稳定性缓解策略:SAE 特征引导(SAE 特征引导)和 SAE 残差校正(SAE 残差校正),前者识别并抑制推理时异常激活的特征,后者学习对 SAE 特征的自适应调整以恢复正确的偏好。我们的方法大大减少了对无害和幻觉基准的错误偏好分配,同时保持其他任务的良性表现和一般效用,而无需重新训练奖励模型。