论文
语言模型中的认知不公正:对预训练过滤器和护栏的审计
Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails
摘要
现代语言模型依靠预训练过滤器从训练语料库中删除不需要的内容,并依靠推理时间护栏来抑制部署期间不需要的输出。在本文中,我们研究了这些过滤和调节决策如何产生认知擦除的形式,并揭示了自动化系统之间以及这些系统与人类判断之间的紧张关系。我们审核了包含性别和地区起源提及的 Common Crawl 句子的四个预训练过滤器和三个推理时间护栏,以及手动注释的 500 个句子的子集。我们的分析表明,过滤和护栏决策与基于黑名单的词汇线索密切相关,而经常无法标记包含私人信息或明确仇恨言论的内容。与此同时,边缘化群体,特别是跨性别者、女性和中美洲人,在各个系统中都被严重过度标记。相比之下,人类注释者会保留 88.5% 的过滤器标记内容和 91.3% 的护栏标记内容,通常会认识到当前系统无法捕获的内容删除紧张所带来的代表性危害。总而言之,我们的研究结果记录了一种认知擦除形式,其中对边缘化群体的提及在预训练之前被不成比例地删除,并且在推理时再次被抑制。