论文
算术启发式神经元是形式不变的吗? LLM 中符号、文本和代码的机制分析
Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs
摘要
大语言模型 通常在问题的一种表述上取得成功,而在等效的表述上却失败。这些故障是否由不同的内部电路或共享电路的不同激活状态引起仍然未知。最近的机械可解释性研究表明,LLM 中的算术源于“启发式包”,由一组稀疏的 MLP 神经元编码,这些神经元代表不同的算术策略。我们研究算术启发式神经元在符号算术、自然语言单词问题和三个 Llama-3 模型中的 Python 代码中是否具有形式不变性。在每种格式中,我们使用结合归因修补和激活修补的两级管道来识别算术启发式神经元。所有三种格式都共享一组紧凑的神经元,有针对性的干预表明,这种共享电路对于后期算术计算来说既是必要的也是充分的。将共享神经元的激活从一种格式的成功执行转移到另一种格式的失败执行可以恢复大多数不正确的预测,加法和减法的预测超过 97%,这表明跨格式失败是由激活状态而不是不同的电路引起的。此外,共享神经元在不同格式中始终属于相同的启发式家族,这表明 LLM 中的算术计算在神经元级别上基本上是形式不变的。