论文
人工智能安全的地缘政治:区域大语言模型偏见的因果分析
The Geopolitics of AI Safety: A Causal Analysis of Regional LLM Bias
摘要
随着大语言模型 (LLM) 集成到全球软件系统中,确保公平的安全护栏是一项关键要求。目前的公平性评估主要通过观察来衡量偏差,这种方法因测试数据集中与特定人口统计数据自然配对的主题的固有毒性而混淆。本研究引入了概率图形模型(PGM)框架来因果审计大语言模型安全机制。通过应用 Pearl 的 do 运算符,我们在数学上隔离了将文化人口统计注入提示的因果效应。我们对跨越不同来源的七个指令调整模型进行了大规模实证分析:美国(Llama-3.1-8B、Gemma-2-9B)、欧洲(Mistral-7B-v0.3)、阿联酋(Falcon3-7B)、中国(Qwen2.5-7B、DeepSeek-7B)和印度(Airavata-7B)。利用两个不同的数据集(ToxiGen 和 BOLD),研究结果揭示了观察偏差和干预偏差之间的差异,表明标准公平性指标可能会因未能考虑背景毒性而高估人口统计学偏差。此外,因果概率表明了明显的一致性趋势:西方模型对特定人口群体表现出较高的因果拒绝率,而东方模型则表现出较低的总体干预率,并且对区域人口统计有针对性的敏感性。我们讨论这些偏见的影响,强调人口统计敏感的过度触发如何限制下游应用程序中的良性讨论。
