论文

在与大语言模型进行民意调查之前:慎重的诊断框架

Before You Poll with LLMs: A Deliberative Diagnostic Framework

模型评测评测方法与指标

摘要

大语言模型可以像人类一样通过新信息进行推理,还是仅仅检索缓存的观点?这对于硅采样至关重要,大语言模型角色大规模模拟公众舆论。目前的评估仅测试人物角色是否持有正确的观点——静态快照。但舆论研究越来越依赖于动态保真度:角色是否会像人类在深思熟虑时所做的那样,根据新的论点更新信念。没有现有的基准测试这一点。我们引入了协商投票诊断框架,该框架比较了相同信息干预后人类和大语言模型的信念转变。它以深思熟虑的民意调查为基础,揭示了静态评估中看不见的失败:产生合理党派意见的模型仍然可能歪曲这些意见的变化方式。使用美国同一个房间的数据(526 个角色,72 个问题)将该框架应用于五个前沿模型,我们发现每个模型都失败了,每个模型都以独特的方式失败。 GPT-5.1表现出逆转:信息平衡后,其角色对对方的敌意变得更强,而人类则变得不那么敌对。这种逆转是有选择性的(80%的人在外群体问题上,26%的人在政策问题上)并且在不同党派身份上是对称的。 Gemini 2.0 Flash、Claude Sonnet 4.5 和 Llama 3.3 70B 表现出过冲,可以正确移动,但速度为人类幅度的 5-7 倍。 DeepSeek V3 表现出几乎零变化的刚性。有针对性的消融揭示了政策内容触发了这些失败,并且它们是特定于身份的:GPT-5.1 在外群体问题上出现逆转,但在内群体问题上出现过冲;双子座则表现出相反的情况。我们将这种特征称为自我奉承:遵循模型对角色的内部刻板印象,而不是根据所提供的信息进行推理。我们的框架提供了一个具体的协议:在信任大语言模型角色模仿修改后的信念之前运行深思熟虑的诊断。