论文
所有电路通罗马:重新思考 LLM 电路和层发现中的功能各向异性
All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs
摘要
在本文中,我们提出了经验和理论证据,反对电路和层发现(CSD)中的一个核心但很大程度上隐含的假设,我们将其称为功能各向异性假说:大语言模型(LLM)中的功能定位于独特或接近独特的内部机制的想法。我们证明,单个 LLM 任务可以由多个结构不同的电路或滑轮来支持,这些电路或滑轮同时忠实、稀疏和完整。为了系统地揭示这种竞争机制,我们引入了重叠感知滑轮排斥,这种方法通过对多个发现运行中的结构重叠进行明确的惩罚来增强 CSD 目标,从而能够在大量常见的 CSD 基准测试中发现具有强大任务性能但共享结构最少的电路或滑轮。我们发现,随着发现的滑轮数量不断增长,并且在主要 CSD 方法中持续存在,这种现象变得越来越明显。我们进一步确定了一个超稀疏的三边束,并表明它的任何边都不是单独不可或缺的,甚至破坏了规范或基本组成部分的弱化概念。为了解释这些发现,我们提出了分布式密集电路假设,并提供了理论分析,证明非唯一的、低重叠的电路解释是在温和假设下自然产生的高维叠加。总之,我们的结果表明 LLM 中的机械解释本质上是不规范的,需要重新思考如何解释和评估 CSD 结果。