论文

没有个人身份就更公正吗?大语言模型的道德判断评测

Justice After Identity: Large Language Models and the View from Everywhere

模型评测鲁棒性、公平性与可信度评测

摘要

寻求正义和公平的共同观点对人类的集体活动提出了挑战,因为我们的不同判断不可避免地受到社会地位、个人利益、文化传承和历史环境等自身利益的影响。著名的约翰·罗尔斯试图通过普及一种被称为“原初立场”的哲学传统来克服这一局限性——这是一种思想实验,人们通过这种思想实验来选择正义原则,而不知道他们将拥有的身份或优势。然而,批评者长期以来一直质疑人们是否可以有意义地悬置自己的社会身份并压制与道德相关的生活经历形式。用于计算算法和agentic公平性的人工智能引入了一种新的可能性。LLM没有单一的阶级、种族、性别、国籍或传记,但它们的参数编码了广泛的人类身份和道德传统的语言表征。也许LLM的伦理判断可以近似于一个综合的原始立场——一种“来自各处的观点”,不是通过排除社会身份,而是通过计算整合其多样性而产生的。人类不太可能通过简单地委托对分配和程序集体过程的完全agentic控制来“将钥匙”交给计算系统。但人工智能可能会发挥一定的作用,也许是积极的作用,与个人和集体的人类判断相互作用,因为我们经常面临关于公平和公正的日益两极分化的观点。我们提供了比较人类、基本模型和前沿/微调模型对经典道德困境的判断的数据,同时系统地改变身份关系和罗尔斯对身份的约束。我们的结论是,如果先进的人工智能系统为人类提供深思熟虑的建议,人类是否真的可能会接受它。