论文

协商赤字:民主话语中LLM的实证批判

The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

模型评测模型能力评测

摘要

LLM 越来越多地部署在需要对复杂、有价值的问题进行集体推理的环境中。对这些部署的信心很大程度上取决于可验证任务(数学、编码、协调游戏)的基准,但其中许多应用程序所涉及的问题不存在客观正确的答案,而决策质量反而取决于整合多元观点以找到双方可接受的解决方案。我们认为,LLM 对此类问题的推理能力不能从可验证的任务基准中完全推断出来,并且对 LLM 话语(尊重、正当性、参与)的程序评估在系统上是不够的。我们应用协商理性指数(DRI),这是一种在政治学中开发并在公民议会中得到验证的衡量标准,作为评估多元化、不可验证问题的可靠群体层面推理的工具。综合 1,980 个五智能体 LLM 在 11 个前沿模型配置中运行的 12 个公民大会主题的最新证据,我们发现 LLM 群体产生的话语的程序质量可与人类审议相媲美,而主体间一致性的收益很小,依赖于主题,并且集中在易于处理的问题而不是道德争议的问题上。 LLM 群体表现出人类集会的大约三分之一的视角多样性,并扭转了人类趋同模式:随着不同观点的综合,人类深思熟虑减少了分散性,而 LLM 深思熟虑则增加了分散性。通过角色提示来实现多样性并不能恢复人类的动态,而是颠倒了更新审慎推理的组成部分。我们的结论是限制性的而不是禁止性的:LLM 可以作为支持人类对多元问题进行推理的工具,但目前的证据并没有允许将它们视为自主审议代理。