论文

驾驭数字频谱:评估 大语言模型 中的政治偏见、稳定性和下游公平性

Navigating the digital spectrum: Assessing political bias, stability, and downstream fairness in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 越来越多地被用作信息中介,但衡量其政治行为仍然脆弱,因为调查问卷结果将模型处置与测量工件和响应引发偏差混合在一起。我们引入了一个强大的政治指南针测试评估框架,该框架在八维扰动空间中对 300 个配置进行采样,其中包括不同的语言、框架、说明、答案格式、选项顺序和角色措辞。我们评估了 14 种语言和 3 个量化级别的 8 个 Gemma 3 和 Qwen 3 模型,获得了具有量化不确定性的设计平均政治坐标。大多数模型平均倾向于自由主义左派,但指令措辞、语言和答案格式显着影响恢复的坐标。跨语言差异主要反映的是坐标漂移,而不是不同的文化推理。对测试进行逆向工程还暴露了轴权重不平衡以及向中心退化响应的崩溃,因此最小模型的近原点估计可以反映微弱的信号而不是中心主义。自由文本推理和先聊天后分类的启发改变了恢复的坐标,更大的模型显示出更清晰的角色分离,而威权左翼角色未能将大多数模型推向预期的社会方向。在下游任务中,角色效应相对于仇恨言论检测的模型大小和目标群体而言是适度的,而基础和中间派提示则为主题级别的情绪提供了最高的一致性。因此,政治角色提示具有可测量但特定于任务和数据集的下游影响。