论文

CSP-Atlas:稀疏 Python 中的概念特定神经电路 Transformer

CSP-Atlas: Concept-Specific Neural Circuits in a Sparse Python Transformer

模型评测模型行为与机制分析

摘要

稀疏 8 层代码 Transformer 为每个测试的 Python 结构开发专用的神经电路,并且该电路是通过干净的计算原理而不是语义类别来组织的。我们通过边缘化 63,800 个受控提示来提取 106 个概念(43 个 AST 节点类型、63 个内置对象)的神经回路,并使用对比检查器提示将每个回路分解为特定于概念和词元驱动的组件,这些提示会呈现没有关联句法结构的关键字词元。出现了三个发现。首先,所有 106 个概念在九个参数设置中的每一个上都会产生非空通用电路,并且跨构造的概念特异性的排名在整个扫描过程中是稳定的 - 生存不是许可阈值的产物。其次,AST 电路包含与词元激活不同的真正概念组件:仅概念神经元构成中后期层最响亮神经元的 62.5%,而内置电路几乎完全由词元驱动。第三,六个计算原子结构 - Import、ImportFrom、Break、Continue、Pass、Assert - 尽管在语义上不相关,但聚集在一起,仅共享不需要嵌套主体的单语句结构的属性;这个原子性超级集群,以及由词元模糊性和结构独特性组织的四层层次结构,表明模型的内部组织跟踪计算结构而不是含义。发布了方法论、完整分解数据和分析代码。