论文

大语言模型 中认知结构的机械解码

Mechanistic Decoding of Cognitive Constructs in Large Language Models

模型评测模型行为与机制分析

摘要

虽然 大语言模型 (LLM) 表现出日益复杂的情感能力,但它们处理复杂情绪的内部机制仍不清楚。现有的可解释性方法通常将模型视为黑匣子或关注粗粒度的基本情感,而没有充分探索更复杂的情感状态的认知结构。为了弥补这一差距,我们提出了一个基于表示工程(RepE)的认知逆向工程框架来分析社会比较嫉妒。通过将评价理论与子空间正交化、基于回归的加权和双向因果转向相结合,我们分离并量化了嫉妒的两种心理前因:比较者的优越性和领域自我定义相关性,并检查了它们对模型判断的因果影响。对来自 Llama、Qwen 和 Gemma 家族的 8 个 LLM 的实验表明,模型本身将嫉妒编码为这些构成因素的结构化线性组合。它们的内部表征与人类心理结构大体一致,将优越性视为基本触发因素,将相关性视为最终的强度乘数。我们的框架还表明,有毒情绪状态可以通过机械方式检测并通过手术进行抑制,这为多智能体环境中人工智能安全的代表性监控和干预提供了一条可能的途径。