论文

隐藏的共识:人类反馈中的偏好有效性压缩

Hidden Consensus:Preference-Validity Compression in Human Feedback

模型评测鲁棒性、公平性与可信度评测

摘要

标准 RLHF 管道通常会将不同的人类判断简化为单个标量奖励目标。我们认为,这种减少可能会错误地衡量结构多元化社会中的一致性,其中分歧可能反映文化、历史、语言、区域或规范基础的解释,而不是注释噪音。我们将这种失败称为“偏好有效性压缩”,即将多个复数有效响应选项折叠为单个优化目标。使用马来西亚作为诊断环境,我们通过跨解释框架链接提示、响应和可接受性判断的偏好事件来分析 RLHF 式反馈聚合。在来自 20 名参与者的 321 个偏好事件和 107 个三重注释提示中,79% 的提示包含多个多数支持的响应,单个获胜者聚合会丢弃这些响应,并且当考虑所有多数支持的选项时,顶部响应之间的明显优势差距会缩小。参与者经常选择多个可接受的答案,而被丢弃的答案显然反映了连贯的当地、实践或文化框架。这些发现表明,该语料库中的多数聚合衡量的是 argmax 可接受性,而不是复数对齐。我们将其视为测量有效性问题,并认为未来的对齐方法应该满足有效性保持一致性,在多个有效解释框架中保持稳定,而不是将它们分解为单个奖励目标。