论文

算法影响揭示对齐中隐藏的社会选择结构

Algorithmic Impact Reveals the Hidden Social Choice Structure of Alignment

模型训练偏好优化

摘要

当一个AI算法做出影响不止一个人的决策时,对齐它就成了一个社会选择问题:人们关于系统行为的分歧偏好应如何被调和并聚合为一个单一连贯的模型?对齐前沿AI模型的标准方法——基于人类反馈的强化学习——在很大程度上回避了这个问题,且社会选择保证较差。然而,尚不清楚应由什么替代方案取而代之。我们表明,通过直接聚焦于算法的福利后果,对齐问题可以被重新表述为凸影响空间上的线性优化,从而使其可以应用福利经济学与机制设计的标准工具箱。这一重新表述澄清了对齐协议如何转化为福利后果,反过来,社会规划者对福利后果的期望约束也可以被翻译回对齐协议。我们应用这一转换,证明按议题投票(voting-by-issues)和随机独裁(random-dictatorship)机制是策略防操纵且一致的。作为反向方向的演示,我们还应用影响表示推导出一族在对齐协议上最大化功利主义社会福利、并满足各种社会期望约束(如个体或群体伤害上限)的对齐协议。我们使用关于肾分配、慈善食物分配、LLM回答与电车难题的真实人类偏好,对这些对齐协议的福利影响进行实证说明。

算法影响揭示对齐中隐藏的社会选择结构:论文配图
图2:Community Alignment数据集:在高选择精度(β=100)下,各机制下2387名标注者个体福利 U_n/U* 的分布。上:功利主义、RLHF与策略防操纵。下:三个福利下限 b 下的有界伤害对齐;淡灰色曲线重复功利主义分布作参照,红色虚线标出下限。收紧下限(趋向0)会约束更多智能体并压缩福利分布,消除受损害的左尾。