论文
灰色阴影中的偏好学习:人类偏好的可解释且具有偏见意识的奖励模型
Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences
摘要
在语言模型中学习人类偏好仍然具有根本性的挑战性,因为奖励模型依赖于微妙的、主观的比较或灰色阴影,而不是明确的标签。这项研究调查了当前方法的局限性,并提出了一个特征增强框架,以更好地捕捉人类判断的多维本质。使用 Anthropic HHRLHF 数据集,我们在标准成对偏好设置下评估了 10 个不同的 大语言模型 LLM,其中基线性能保持低于 0.74 ROC AUC,突出了任务的难度。为了解决这个问题,我们用可解释的信号丰富了文本表示:响应长度、拒绝指标、毒性评分和提示响应语义相似性,使模型能够明确捕获有用性、安全性和相关性的关键方面。所提出的混合方法在所有模型中产生了一致的改进,实现了高达 0.84 ROC AUC 和显着更高的成对精度,其中 DeBERTav3Large 展示了最佳性能。除了准确性之外,我们还集成了 SHAP 和 LIME 以提供细粒度的可解释性,揭示模型决策取决于情境安全性和支持性框架,而不是孤立的关键字。我们进一步分析偏差放大,表明虽然个体特征的边际效应较弱,但它们的相互作用会影响偏好学习。