论文

从早期编码到后期抑制:解读字符计数任务中的 LLM

From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks

模型评测模型行为与机制分析

摘要

尽管在复杂的基准测试中表现出色,但 大语言模型 (LLM) 在基本符号任务(例如单词中的字符计数)上表现出失败。尽管已经注意到这一限制,但内部原因仍不清楚。我们使用字符计数(例如,“苹果中有多少个 p?”)作为最小的受控探针,将 词元级 推理与更高级别的混淆隔离开来。使用此设置,我们发现了现代架构(包括 LLaMA、Qwen 和 Gemma)中的一致现象:模型通常在内部计算正确的答案,但无法在输出层表达它。通过结合探测分类器、激活修补、logits 镜头分析和注意力头跟踪的机制分析,我们表明字符级信息被编码在早期和中层表示中。然而,此信息会被后面层中的一小部分组件削弱,特别是倒数第二层和最后一层 MLP。我们将这些组件识别为负电路:降低正确信号权重以支持更高概率但不正确的输出的子网络。我们的结果带来了两项贡献。首先,我们表明 LLM 中的符号推理失败并不是由于缺少表示或规模不足,而是由于模型计算图中的结构化干扰引起的。这解释了为什么此类错误持续存在,并且在缩放和指令调整下可能会恶化。其次,我们提供证据表明 LLM 前向传递实现了一种竞争解码形式,其中正确和不正确的假设共存并动态重新加权,最终输出由抑制和放大决定。这些发现对可解释性和鲁棒性具有影响:简单的符号推理暴露了现代 LLM 的弱点,强调需要确保信息编码和可靠使用的设计策略。