论文

超越阿罗不可能定理:多Agent协作中的涌现公平性

Beyond Arrow's Impossibility: Fairness as an Emergent Property of Multi-Agent Collaboration

智能体系统Agent 协作

摘要

语言模型的公平性通常被视为单个、集中优化模型的属性。随着大模型越来越多地用于Agent系统,本文提出公平性也可通过交互与交换涌现。研究使用受控的医院分诊框架,让两个Agent进行三轮结构化辩论:一个通过检索增强生成(RAG)遵循特定伦理框架,另一个则未做对齐,或被对抗性提示引导,以人口群体身份而非临床需要作为分配依据。研究发现,对齐会系统性地影响协商策略和分配模式。双方单独作出的分配都未达到伦理要求,但联合最终分配可以满足任何一方独立决策时都无法达到的公平标准。经对齐的Agent通过争辩、而非直接否决对方,部分缓解偏见,恢复边缘群体获得资源的机会,同时并未完全改变有偏见的一方。研究还观察到,即使明确经过对齐的Agent,也会偏好某些伦理框架,这与大模型已知的左倾倾向一致。本文将这些局限与阿罗不可能定理联系起来:不存在同时满足所有集体理性要求的聚合机制;多Agent协商是在应对这一约束,而非消除它。因此,公平性应被视为分散Agent交互中涌现的程序性属性,评估对象应是整个系统,而非单个Agent。