论文
说谎还是不说谎? LLM 调查全球谎言的偏见传播
To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs
摘要
虚假信息呈上升趋势,LLM强大的写入能力降低了恶意行为者制作和传播虚假信息的门槛。我们研究了 LLM 在被提示跨语言和目标国家传播错误信息时的行为,并引入了 GlobalLies,这是一个多语言并行数据集,包含 440 个错误信息生成提示模板和 6,867 个实体,涵盖 8 种语言和 195 个国家/地区。通过使用人类注释和来自最先进模型的数十万代人的大规模 LLM 作为法官评估,我们发现错误信息的生成根据所讨论的国家而系统地变化。在许多资源匮乏的语言以及人类发展指数 (HDI) 较低的国家中,LLM 的谎言传播率要高得多。我们发现现有的缓解策略提供的保护不均匀:输入安全分类器表现出跨语言差距,并且由于信息可用性不平等,检索增强的事实检查在各地区之间仍然不一致。我们出于研究目的发布 GlobalLies,旨在支持制定缓解策略,以减少全球错误信息的传播:https://github.com/zohaib-khan5040/globallies