论文

从自我到他人:评估 LLM 仇恨言论注释中的人口统计视角

From Self to Other: Evaluating Demographic Perspective-Taking in LLM Hate Speech Annotation

模型评测模型能力评测

摘要

仇恨言论检测本质上是主观的:来自不同人口群体的人对相同内容的看法截然不同。从多个人口群体收集足够的注释成本高昂且难以扩展。角色条件 大语言模型(提示采用特定人口统计身份的模型)已被提议作为大规模模拟不同观点的方法。但它们实际上反映了不同群体的分歧吗?我们评估人类社会判断的三个方面:(i)来自不同群体的角色是否以类似人类的方式存在分歧(群体间分歧),(ii)当内容针对他们自己的身份时,他们是否变得更加敏感(群体内敏感性),以及(iii)他们是否能够准确预测另一个群体将如何反应(替代预测)。我们的结果表明,没有模型能够一致地捕获所有三个维度,并且性能高度依赖于模型,并且不能仅从最小的身份提示中可靠地出现。然而,Llama 3.1 的替代提示在大多数人口统计轴上产生了最高的跨组一致性,并提供了最接近人类分歧模式的整体近似值,表明这种配置可以为与人类判断一致的自动注释提供更可靠的设置。