论文

检查LLM推理中的社会归因:理论引导的探究方法

Examining Social Attribution in LLM Reasoning: A Theory-Guided Probing Methodology

模型评测基准与评测资源模型行为与机制分析

摘要

大语言模型(LLM)越来越多地部署在社会技术系统中,其中社会归因(将外部事件归因于主体社会行为的原因和原因的推理过程)发挥着关键作用。这些过程涉及对社会事业、责任以及对Agent的责备/信用的判断。尽管通过归因理论在社会心理学和认知领域对归因模型进行了充分研究,但在人工智能领域,尤其是LLM的社会推理领域,社会归因仍然没有得到充分探索。本文对LLM社会归因进行了首次系统探索。我们的工作重点是责任和过失归因,检查当前LLM的判断及其潜在的内部机制。在归因理论的指导下,我们构建了一个社会归因基准,由基于归因理论研究经典场景的 Vignette 子集和基于现实世界社会叙事的 Reality 子集组成,产生了 7,639 个责任/过失判断问题。在此基础上,我们评估了32个具有代表性的LLM和5个基础的非LLM 基线。为了进一步探索LLM判断过程背后的内部机制,我们开发了一种基于探测的方法来研究5个关键归因维度的潜在空间表示,以及与人类社会归因相比它们对LLM判断影响的一致性。我们的研究结果表明,当前的LLM与人类责任和指责判断表现出可测量但不完全的一致性,同时,这种一致性与模型大小正相关。一些归因维度可以从LLM隐藏状态的特定位置系统地解码,它们对最终判断的影响与人类归因理论所表明的一致。数据集和相关代码可在https://github.com/Yuzhaoxin946/SAB-Bench.获取