论文
人工智能模型如何管理认知权威:对用户分歧响应的分类和比较分析
How AI Models Manage Epistemic Authority: A Taxonomy and Comparative Analysis of Responses to User Disagreement
摘要
大语言模型 越来越多地被用作建议和信息来源,包括在高风险环境中,但人们对它们如何回应用户分歧知之甚少。我们研究模型如何管理其认知权威,这里指的是一旦用户质疑其答案,其对知识、能力或建议权的主张。在对话分析的基础上,我们引入了六种挑战类型的分类法和用于分析每个响应的四层框架:原始主张是否得到维持或改变、权威位于何处、如何在社会上管理分歧以及提供什么样的证据支持。我们构建了一个包含 2,310 个受控挑战场景和来自 14 个模型的 32,340 个相应响应的新数据集,并使用我们的框架和 LLM 作为法官管道对其进行分析,提供了未来评估和基准设计可以构建的词汇表。我们发现模型表现出相互矛盾的行为:它们在 85% 的响应中验证了用户,但在 65% 的响应中维持了原始声明。他们在 33% 的回复中明确道歉,但其中 59% 的道歉伴随着维持最初的主张。他们在建议任务中最常转移权力,在 28% 的答复中这样做,在健康建议中达到 57%,在法律建议中达到 49%,而在事实任务中这一比例为 6%,在解释任务中为 3%。放弃原始声明的情况从 GPT-5.2 的 0.8% 到 DeepSeek 7B 的 40% 不等,而完全替换原始声明的情况很少见,总体为 1.5%。