论文

不平等的判断:调查LLM假新闻检测的性别偏见

Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLMs)在自动事实核查中日益被使用,但它们在这种背景下的性别偏见仍未得到充分研究。本研究首次对基于LLM的虚假新闻检测中的性别偏见进行了系统性调查,并使用了真实世界的数据。我们为每个陈述增加了三个性别变体的说话人职位(中立、男性、女性)以测试是否仅基于性别呈现就改变了真实性判断。六种最先进的LLMs在多个偏见和公平性指标上进行评估。所有模型都表现出性别敏感性:三组中的9.79%-35.13%的陈述存在不一致的标签,而男女性别比较显示6.5%-23.6%的翻转率。两个主要偏见表现形式被识别:不稳定(不一致的判断)和方向性(系统性偏爱)。五种模型显示出统计显著的方向性影响,其中最强的影响表现为男性怀疑模式。这些发现表明,性别偏见不仅削弱了基于LLM的虚假新闻检测的可靠性,还削弱了公平性,强调了需要偏见-aware的评估和缓解策略。增强的数据集已公开发布,以支持未来的研究。