论文
线性表示是如何学习的?抽象动态的精确解决方案
How are linear representations learned? Exact solutions to the dynamics of abstraction
摘要
在人工和生物神经网络中,概念通常被编码为表示空间中一致的线性方向。在深度学习中,这个想法被称为线性表示假设,并支持许多基于线性探针的可解释性和控制方法,从概念检测到激活控制。然而,虽然之前的工作已经研究了这些方向是否应该在 $\textit{after}$ 训练中存在,但它们如何在 $\textit{during}$ 训练中出现的动态仍然知之甚少。在这里,我们开发了一个框架来研究训练期间概念方向的一致性 - 我们称之为“抽象”的过程。在最小线性网络设置中,我们获得了完整抽象轨迹的精确解。这些解决方案揭示了控制抽象的关键分析原则:(i)数据和目标几何形状在学习结束时共同确定抽象,(ii)抽象随着网络深度而提高,(iii)初始化规模控制训练期间达到的最大抽象。将我们的理论扩展到非线性网络,我们分析了非线性的选择如何影响抽象动力学:erf 网络近似于线性理论,而 ReLU 网络中的抽象较少依赖于目标几何形状,而更多地依赖于输入几何形状。在这两者中,我们证明了一个惊人的衰减定律:两种非线性都削弱了激活相对于预激活的抽象性。我们在开放模型(DINOv3、Gemma 4)中找到了该定律的证据,并应用我们的理论来改进 LLM 中的线性探针泛化。总之,我们的结果提供了一种抽象的动态理论,对可解释性和控制具有影响。