论文
使用多智能体视角偏好优化学习性别歧视检测
Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization
摘要
当人们给文本贴上性别歧视标签时,他们常常不同意,并不是因为其中一些人是错误的:他们对性别歧视的看法确实不同。大多数 NLP 系统通过将其压缩为多数投票来放弃这种分歧。我们提出了多智能体视角偏好优化(MAP-PO)框架来保留这些不同的视角。在带有标签的英语和西班牙语推文的 EXIST 2024 数据集上,我们首先根据注释者的标签行为而不是其人口统计属性对其进行聚类。然后,我们对每个集群的一个 大语言模型 代理进行微调,以重现该集群的注释行为,并通过结合个人和团队级别奖励的偏好优化来协调代理。我们在由两种语言和两个骨干语言模型定义的四种设置中评估 MAP-PO,询问每个代理是否再现其自己集群的注释以及代理是否一起再现多数标签。有两项发现适用于所有四种情况。首先,如果没有 微调,代理的行为几乎相同,因此需要针对集群进行训练。其次,我们表明,仅在其自己集群的标签上训练每个智能体会使智能体远远超出它们应代表的集群,而添加共享的团队级训练信号始终使每个智能体校准到其集群。