论文
可见的黑暗:读取语言模型的异常处理程序
Darkness Visible: Reading the Exception Handler of a Language Model
摘要
GPT-2 Small 的最终 MLP 展示了一个完全清晰的路由程序——27 个命名神经元被组织成一个三层异常处理程序——而它路由的知识仍然与约 3,040 个剩余神经元纠缠在一起。我们将所有 3,072 个神经元(以数值精度)分解为:5 个融合核心神经元,将词汇重置为功能词,10 个区分器,抑制错误候选者,5 个专家,检测结构边界,以及 7 个共识神经元,每个神经元监控不同的语言维度。共识与例外交叉(MLP 干预从有益转变为有害)在统计上是尖锐的(自举 95% CI 在所有共识水平上排除零;交叉在 4/7 和 5/7 之间)。三项实验表明,该模型 L11 的“知识神经元”(Dai 等人,2022)充当路由基础设施而不是事实存储:MLP 放大或抑制来自注意力的残余流中已经存在的信号,并根据上下文约束进行缩放。花园小路实验揭示了反向花园小路效应——GPT-2 立即使用动词子分类,与以 词元级 可预测性而不是句法结构运行的异常处理程序一致。这种架构仅在终端层具体化——在更深的模型中,我们预测最后一层的等效结构,而不是第 11 层。代码和数据:https://github.com/pbalogh/transparent-gpt2