论文
算法影响揭示对齐中隐藏的社会选择结构
Algorithmic Impact Reveals the Hidden Social Choice Structure of Alignment
摘要
当一个AI算法做出影响不止一个人的决策时,对齐它就成了一个社会选择问题:人们关于系统行为的分歧偏好应如何被调和并聚合为一个单一连贯的模型?对齐前沿AI模型的标准方法——基于人类反馈的强化学习——在很大程度上回避了这个问题,且社会选择保证较差。然而,尚不清楚应由什么替代方案取而代之。我们表明,通过直接聚焦于算法的福利后果,对齐问题可以被重新表述为凸影响空间上的线性优化,从而使其可以应用福利经济学与机制设计的标准工具箱。这一重新表述澄清了对齐协议如何转化为福利后果,反过来,社会规划者对福利后果的期望约束也可以被翻译回对齐协议。我们应用这一转换,证明按议题投票(voting-by-issues)和随机独裁(random-dictatorship)机制是策略防操纵且一致的。作为反向方向的演示,我们还应用影响表示推导出一族在对齐协议上最大化功利主义社会福利、并满足各种社会期望约束(如个体或群体伤害上限)的对齐协议。我们使用关于肾分配、慈善食物分配、LLM回答与电车难题的真实人类偏好,对这些对齐协议的福利影响进行实证说明。
