论文
AuAu:大语言模型 中审计威权联盟的基准
AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models
摘要
威权主义在全球范围内的兴起以及 大语言模型 (LLM) 在用户日常生活中日益重要的作用提出了特定模型是否表现出或宣扬威权态度的问题。我们引入了 AuAu,这是一个用于评估 LLM 响应中独裁倾向风险的综合基准。 AuAu 结合了三种评估方法:(i) 来自 15 个经过人类验证的仪器的心理测量问题,(ii) 在具体情况下探究预期行为的小插图,以及 (iii) 对现实用户提示的响应。与之前的工作不同,AuAu 不仅衡量总体威权主义一致性,还衡量其既定的子概念:威权侵略、威权服从和传统主义。通过评估来自中国、欧盟、俄罗斯和美国的 17 个模型,我们发现所有模型对心理测量工具的专制响应率都很高,尽管在更现实的下游任务上,响应率显着下降。此外,一个简单的威权制度提示操纵 17 个模型中的 15 个来促进威权主义的增强。我们的结果强调需要对基于 LLM 的人工智能系统进行持续、系统的审计,以检测和减轻其输出中的独裁倾向。