论文
AmchiBias:使用英语和孔卡尼语的最小配对数据集测量果阿身份群体中的刻板偏见
AmchiBias: Measuring Stereotypical Bias in Goan Identity Groups with a Minimal Pair Dataset in English and Konkani
摘要
社会文化刻板偏见是 NLP 系统开发和部署的一个重要考虑因素。然而,尽管地方社会文化结构丰富,但它往往只在国家层面被考虑。我们推出 AmchiBias,这是衡量印度果阿邦独特的历史多元文化背景的社会文化刻板偏见的第一个基准。它涵盖了各种果阿身份群体,由 313 个最小对组成,涉及英语和梵文孔卡尼语的八个社会人口维度。然后,我们在此基准上评估五种多语言编码器模型的刻板偏见。我们发现孔卡尼语的分数接近偶然,反映出一般多语言模型的语言不能力以及印度语言模型缺乏果阿文化能力。用英语进行查询时,印度语言覆盖范围较强的模型显示出对泛印度群体的偏见高于超本地果阿群体。这表明英语信号反映了泛印度预训练协会,而不是真正的果阿文化知识。我们的研究结果凸显了超本地社区身份的低资源多语言 NLP 评估中存在的关键差距。