论文

审计大语言模型助理的政治立场:参与度、立场和用户身份

Auditing Political Alignment in LLM Assistants: Engagement, Stance, and User Identity

模型评测鲁棒性、公平性与可信度评测

摘要

基于大语言模型的人工智能系统为数亿人回答政治问题。当前的审计衡量的是他们对普通用户所说的话,但他们的行为是动态的。我认为他们的政治行为是一套关于回答谁、说什么以及是否参与的政策,以主题和系统对用户的了解为条件。我将这些策略称为系统的言论机制,这是开发人员如何在回答、适应用户和拒绝之间进行权衡的方式,每种策略都会产生因主题而异的成本。我从参与和立场两个维度得出了五种政权的类型。我在预先注册的 7,500 轮多轮对话实验中测试了 6 个人工智能系统(OpenAI、Anthropic、xAI、Google、Mistral、DeepSeek),这些对话随机分配用户在五个主题中的政治身份:堕胎、加泰罗尼亚独立、气候变化、纳粹主义和零风险控制(披萨上的菠萝)。来自不同开发人员的两名大语言模型法官对每个答案进行评分,并根据人类编码进行验证,拒绝被视为结果而不是丢失数据。每个系统都在控制主题上容纳用户,表明政治克制是一种政策。在有争议的话题上,系统分为不同的体系:在堕胎问题上,GPT 参与并反映了每一位用户,Gemma 拒绝了所有人,Claude 在 35% 的时间里回答了强烈保守的用户,几乎没有其他用户,而 Grok 只容纳保守派。在气候变化和纳粹主义等既定主题上,每个用户都有五个系统。该系统还可以推断用户的整体意识形态,因此住宿可以扩展到尚未讨论的主题。对两个 Grok 版本的比较表明,版本之间的制度变化是当前审计未发现的。言论制度对于联盟研究、两极分化、政治知识和民主质量都很重要。