论文
RLHF偏好数据中的评分者状态偏差:一个审计框架
Rater State Bias in RLHF Preference Data: An Audit Framework
摘要
我们在基于人类反馈的强化学习(RLHF)中识别出一个结构性混杂。成对偏好标签本应反映被比较的输出,但也可能反映评分者标注时的状态。在持续的压力或困扰条件下,评分者的偏好可能随时间漂移,使偏好数据在响应质量判断之外还编码了评分者状态。我们认为,若存在,这类漂移将不同于普通的分歧或随机标签噪声:它是状态依赖的,可能在相似条件下跨标注者共享,并且不必然在聚合、奖励建模与策略优化中相互抵消。我们提出“评分者状态漂移”作为RLHF偏好数据中结构性偏差的一个合理且可检验的来源。本文发展了一个用于研究该偏差来源的假设与审计框架:定义评分者状态漂移、评分者状态混杂与相关评分者状态偏差;提出“生存层情绪本真性”作为候选输出签名——由词汇、语用、篇章与安全特征定义,其信度与效度尚待证明;分析相关评分者状态偏差在何种条件下不会在聚合中被平均掉、并可能进入学到的奖励信号;给出五项将该机制与泛泛的参与度优化区分开的预测及初始审计的效应量阈值,并注明哪些需要专有数据;最后给出可应用于公开指令微调模型的审计协议与试点研究计划。我们不推断任何具体已部署模型的训练历史。