论文

带有偏见的大语言模型评审的主动偏好学习的优化设计

Optimal Design for Active Preference Learning with Biased LLM Judges

模型训练偏好优化

摘要

从人类偏好中学习是大语言模型 (LLM) 对齐的核心,但人类偏好注释的成本很高。主动偏好学习通过选择信息丰富的比较来降低这种成本,并且大语言模型评审可以提供额外的可扩展反馈。然而,评审的偏好可能会偏离目标人群的偏好。即使在对可信参考数据进行校准之后,主动采集也可以改变比较分布并暴露残留的判断偏差。因此,我们将判断偏差纳入采集设计中,而不是依赖于单独的校准阶段。在联合估计下,似乎对奖励信息丰富的比较也可能反映出评审偏见,因此提供的有关人类偏好的信息较少。为了解决这个问题,我们提出了扰动调整优化设计(NAOD),这是一种比较选择策略,在扰动调整后优先考虑与策略相关的目标信息,并使用 Frank-Wolfe 算法进行优化。理论上,我们建立了政策风险的尖锐条件局部渐近极小极大下界,并构造了一个实现它的估计器。我们进一步描述了学习令人讨厌的表示的有限样本成本,并表明表示错误可以扭转预言机设计的优势。最后,我们通过实验验证这些预测,并在 17 名评委、15 种预算配置和 15 种随机集群级别分割的 Chatbot Arena 数据上评估 NAOD。相对于匹配的目标信息设计,NAOD 将代理策略的平均后悔率降低了 29.1%,优于现有方法,并改进了对保留数据的人类偏好预测。