论文
大语言模型 中的 Animacy 所在:追踪 Animacy 概念的回路
Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept
摘要
在书面语言中区分有生命和无生命的概念需要的不仅仅是浅层文本处理,因为它涉及识别复杂的选择约束和上下文线索,例如动词与参数的交互。然而,当前的 大语言模型 (LLM) 似乎能够做到这一点。我们研究了 LLM 的这种生命敏感行为是否可以追溯到一组局部的因果相关组件和连接。为此,我们构建了一个最小对的受控数据集,并在四个开放权重模型上执行电路发现。通过深入的实验和消融,我们证明了这些模型中确实存在负责处理生命力的因果机制,从而发现了生命力回路。与此同时,与其他已知的电路相比,该电路似乎不太本地化,并且仅部分地跨模型和生命力任务进行概括,证实了生命力概念的分布式、上下文相关和某种程度上的分级性质。