论文
人类和大语言模型如何将性别解读为“性别中立”的身体描述
How Humans and LLMs Read Gender into "Gender-Neutral" Physical Descriptions
摘要
当基础模型描述人时,人工智能公平性、可访问性和道德方面的最新工作建议避免推断的身份标签(例如“她”、“他的”),而倾向于看似“客观”的物理描述(例如“短发”、“明确的下巴轮廓”)。然而,这种描述性语言是否能够实现性别中立的沟通仍然是一个悬而未决的实证问题。为了研究这个问题,我们引入了 GAPA(身体属性的性别关联),这是一个包含来自不同来源的 316 种常见身体属性的数据集,与来自 304 位美国注释者的 14,706 个性别关联评级配对。结果表明,身体描述在读者中带有结构化和分级的性别关联,与非二元身份相比,女性和男性的关联更加一致和独特。接下来,我们根据人类评分评估跨模型系列、规模和训练后变体的 16 个大语言模型。这些模型部分恢复了人类关联,但表现出系统性的一致性偏差,包括压缩的评分分布、与男性关联的较弱一致性,以及不成比例地针对非二元类别的不对称弃权。最后,我们发布了性能最佳的代理模型,该模型经过训练可以预测人类描述性语言的性别关联,并通过对 LitBank 中的角色描述进行社会语言学分析来证明其实用性。总之,我们的研究结果提供了第一个经验证据,证明看似“客观”的身体描述可以在人类解释中保留系统的性别关联,并揭示模型与人类错位的系统模式。这挑战了用物理描述取代明确的性别标签必然会产生性别中立的沟通的假设,并凸显了使用此类描述在人类与人工智能交互中传达主观身份类别的下游挑战。