论文
配对模型实验指向后训练对地缘政治偏向的影响
It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt
摘要
人们通常认为,语言模型的地缘政治偏向源于预训练数据。本文在英、法、中文中,使用覆盖 28 对国家的配对情境强制选择测试,比较七家机构的开放权重模型对,每对包括仅预训练的基础模型和经预训练、后训练的对话模型。研究发现,所测偏向主要在后训练后形成,而非基础模型中已有。 七家机构中有六家模型在后训练后,向开发者所属国家或地区相关方向偏移。Qwen 2.5 的变化最强:基础模型对中国偏好的对数优势为 -0.15,p=0.15,对话模型为 +2.91,p<10^-4,对应优势比变化约 18 倍。其他模型也出现对不同国家偏向的变化。幅度还取决于提示语言,例如 Mistral 仅在法语提示下表现出亲法国偏向,法语相较英语的变化为 +1.91,p<10^-4。结果提示,模型的地缘政治偏好不只来自互联网数据,也受到后训练塑造,需要提高相关对齐流程的透明度并进行审查。