论文

通过抽签加权RLHF实现民主偏好对齐

Democratic Preference Alignment via Sortition-Weighted RLHF

模型训练偏好优化

摘要

AI系统应学习谁的价值?RLHF等基于偏好的对齐方法从人类评分者那里获得训练信号,但这些评分者群体通常是便利样本,会系统性地过度代表某些人口群体、而代表不足另一些群体。我们提出民主偏好优化(DemPO),这一框架将算法抽签——与组建公民议会相同的机制——应用于基于偏好的微调。DemPO提供两种训练方案。Hard Panel仅使用通过抽签抽出的、满足配额的微型公众(mini public)的偏好进行训练。Soft Panel保留全部数据,但按每位评分者在抽签抽选中的入选概率对其重新加权。我们证明Soft Panel加权能以闭式形式恢复Hard Panel目标的期望。利用一个将人类判断与评分者人口统计特征配对的公开偏好数据集,以及一份由代表性美国小组独立导出的、含75项条款的宪法,我们评估了在每种方案下微调的10亿至80亿参数Llama模型。在六种聚合方法中,Hard Panel始终排名第一,Soft Panel始终优于未加权基线,且效应量随模型容量增大而增长。这些结果表明,在偏好收集阶段强制人口统计代表性(而非事后校正),能够得到行为更好反映代表性公众所表达价值的模型。

通过抽签加权RLHF实现民主偏好对齐
图1:用于民主偏好对齐的DemPO流水线。一个有偏见的、自我选择的数据标注者群体,通过受人口统计配额约束的算法抽签,被转化为具有人口代表性的微型公众(mini-public)。随后,来自这一代表性小组的偏好(Hard Panel),或来自所有标注者的按选择概率加权的偏好(Soft Panel),被用于RLHF训练,从而产生与更广泛公众价值对齐的AI系统。