论文

PoliticsBench:通过多回合角色扮演对 大语言模型 中的政治价值观进行基准测试

PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay

模型评测基准与评测资源

摘要

虽然 大语言模型 (LLM) 越来越多地被用作主要信息来源,但它们潜在的政治偏见可能会影响其客观性。 LLM 社会偏见的现有基准主要评估人口刻板印象,而在衡量政治偏见时,是在粗略的水平上进行的,忽略了塑造社会政治推理的价值观。我们引入了 PoliticsBench,这是一个多阶段角色扮演基准,用于评估 LLM 中细粒度的价值表达。在二十种不断变化的场景中,模型阐明了权衡、采取立场并在竞争压力下做出决策。在八个著名的 LLM 中,我们发现基于场景的提示比直接的政治问题引发更广泛、更强烈的价值特征,高峰互动阶段使强烈激活的价值维度的数量增加了约 0.75 (总维度 10 个),相对于基线提示而言,统计上显着增加($p < 0.05$)。此外,在互动过程中,对立场的承诺会增加,从初始阶段到决策阶段,在 $[0,5]$ 范围内增加约 $1.4$ 点。虽然在后期的互动阶段,对情景释义的反应变得不那么稳健,但法官间的一致性仍然相对稳定。我们的结果表明,评估 LLM 政治行为需要超越静态提示,转向更长的交互设置,以捕获价值观在上下文中的应用方式。