论文

IndoBias:印尼语 LLM 偏见评估的双轨文化基准

IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages

模型评测鲁棒性、公平性与可信度评测

摘要

尽管印度尼西亚拥有 1300 多个民族和 700 种土著语言,但 大语言模型 中的偏见尚未在印度尼西亚得到充分研究,因此在评估其独特的广阔、多语言和多样化的社会文化景观中的代表性公平性和本地化刻板印象方面存在着重大差距。为了解决这个问题,我们引入 IndoBias 作为基于文化的偏见基准,以评估印度尼西亚语和三种当地语言(爪哇语、巽他语和望加锡语)的 LLM 偏见。 IndoBias 具有双重视角评估轨道:深度导向(对比对)和广度导向(基于世代),后者基于社会科学框架(SPI、O*NET 和 WGI)。我们的结果表明,现有的 LLM(尤其是解码器模型)对印度尼西亚语的原型句子表现出强烈的偏见,而本地语言在意识形态和宗教类别下遭受更高的偏见。我们还发现,当用各种本地实体进行提示时,LLM 响应表现出不一致的刻板印象极性。最后,我们发现,在印度尼西亚语中,与人工审阅的文章文本(例如维基百科、新闻)相比,Common Crawl 文本在预训练期间引入了更多偏差,而在预训练中引入本地语言通常会增加偏差。这项工作强调了研究特定文化背景下的偏见的重要性。警告:本文包含可能令人反感、有害或有偏见的示例数据。