论文
从不一致人类反馈中的可靠性感知LLM对齐
Reliability-Aware LLM Alignment from Inconsistent Human Feedback
摘要
基于人类反馈的强化学习(RLHF)对把大语言模型(LLM)与人类偏好对齐至关重要。但其效力常被人标注固有的不一致与主观性损害。既有偏好优化框架(如直接偏好优化DPO)通常把高分歧的含糊对与全票共识对同等对待,迫使模型过拟合不一致的监督信号、导致次优对齐。本工作提出可靠性引导偏好优化(RGPO),一个旨在缓解不一致人类反馈影响的鲁棒框架:RGPO估计标注者可靠性、从带噪人类反馈推断潜在真值标签以识别稳健偏好;进一步引入可靠性感知的一致性优化,按标注共识水平动态调节训练目标,确保模型优先采纳高共识监督信号。在LLM对齐基准上的大量实验显示:RGPO有效降低训练数据的不一致与噪声,取得优于广泛采用的RLHF基线的表现。代码与配置见https://github.com/GenieHuang/RGPO。
