论文
适应性多元联盟:动态人工民主的管道
Adaptive Pluralistic Alignment: A pipeline for dynamic artificial democracy
摘要
流行的调整方法针对的是一组固定的偏好,因此随着社会规范随着时间的推移而演变,存在迫使价值锁定的风险。我们引入了自适应多元对齐(APA),这是一种模块化管道,用于更新多元对齐的人工智能系统,以跟踪不断变化的价值并避免价值锁定,而无需重复昂贵的预训练或大规模数据收集。 APA 分为三个阶段:(1)通过低秩奖励基础分解学习紧凑的个性化奖励模型,(2)使用这些模型作为陪审团,通过社会选择理论投票集体选择候选输出,以及(3)随着价值的变化,通过在固定奖励基础上拟合新的注释器权重,随着时间的推移有效地适应陪审团。由此产生的系统是高效的、可解释的、可操纵的和模块化的。我们使用 PRISM 多用户对齐数据集和模拟历史注释器实现概念验证实例,并提供初步分析,表明陪审团组成和投票规则的选择可以极大地影响结果,特别是当陪审团偏好不同时。我们在 https://github.com/RachelFreedman/apa 提供完整的代码和结果偏好数据集。