论文

政治学:评估 LLM 作为政治与选举中的信息调解者

Polistemics: Evaluating LLMs as Information Mediators in Politics & Elections

模型评测基准与评测资源

摘要

随着 LLM 越来越多地影响公民所依赖的政治信息,但不存在标准来评估他们是否负责任地这样做。我们引入了 Polistemics,这是一种基于理论的诊断基准,用于评估 LLM 作为选举中政治信息的调解者。先前的工作将这项任务视为复制而不是中介,而未解决其认知维度以及与不完美信息的相互作用。我们以认知谦虚为基础进行评估,这是一种源自公民认知机构的规范标准,并在不同的可用证据的清晰度、噪声和一致性的受控环境中对其进行测试。将基准应用于 2025 年德国和荷兰选举中三个最先进的 LLM,我们发现高总分掩盖了系统性故障。模型在明确的证据下可靠地进行调解,但当证据不存在、模糊或矛盾时就会崩溃,同时削弱整个政治语言的强度。这些失败都指向政党的先验,随着政党标签和输出语言的变化而变化。可靠的中介似乎是可以实现的,但没有任何模型能够始终如一地实现这一目标。