论文

语言模型群体重放人类推理讨论时高估共识

Language-model groups overstate consensus when replaying human deliberation on a reasoning task

模型评测模型行为与机制分析

摘要

完全共识率常被视为集体认知的指标,但它取决于如何操作化定义参与及最终状态。我们用匹配的大语言模型智能体群体重放100个留出的人类Wason任务讨论组,为每位参与者依据其讨论前答案初始化一个信念锚定智能体,并用同一代码对人和智能体评分。不同人类评分定义下,共识估计为24.0%—57.0%;约五分之一的人类参与者从未发言,而智能体几乎总是发言。在两项揭盲后敏感性分析中,智能体群体依然更趋于共识:按提交结果比较(n=98),聊天和推理模式的差距分别为34.0和43.9个百分点;匹配参与情况的比较(n=45)中,分别为34.1和44.4个百分点。这两条互补路径减少了不同测量不对称,结果却相差不超过0.5个百分点。取消提前停止、并重新参数化以移除可记忆答案后,差距依然存在;此时推理模式群体几乎一致,但多数同意的是错误答案。模拟共识未随集体准确性变化,在此设置下,信念锚定智能体群体对人类群体结果分布的估计有偏。这些分析为评估模拟群体对人类审议结果的估计提供了明确评分口径的基础。