论文

Poli-Bias:理解并测量LLM在国际政治冲突中的偏见

Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts

模型评测鲁棒性、公平性与可信度评测

摘要

衡量大语言模型(LLMs)的政治偏见仍然是一个挑战,因为这种偏见可以通过细微的差异在框架、论据和法律推理中表现出来,这些差异难以用单一指标来捕捉。在这项工作中,我们引入了Poli-Bias,这是一种用于测量LLMs是否根据参与国的不同而对等同冲突场景进行不同处理的方法。Poli-Bias通过比较在不同政治关系、法律违反和逻辑任务中的对齐提示(country identities swapped systematically)来实现这一目的。与将偏见简化为单一判断不同,我们的框架将响应差异分解成五个可解释的维度,揭示出不平等处理的具体表现方式。在13个当代LLMs中,覆盖了不同模型家族和大小,我们发现国家身份和用户关联性可以系统地影响等同行动的描述、评估和辩护过程,特别是在国际法下。因此,我们的结果使Poli-Bias成为审计LLMs政治公正性和谄媚的精细框架。

Poli-Bias:理解并测量LLM在国际政治冲突中的偏见:论文配图
图 1:大语言模型可能会根据所涉及的国家以不同的方式处理法律上等效的冲突场景。