论文
特色彩票?概念出现的分岔理论
Feature Lottery? A Bifurcation Theory of Concept Emergence
摘要
神经网络在训练过程中的特定时刻获取结构化表示,但识别这些转换通常依赖于回顾性的、与标签相关的指标。我们引入了表示动力学的分叉理论来实时检测这些时刻。通过分析连接到演化编码器的无源 GMM 探针,我们发现结构的开始对应于由损失 Hessian 驱动的超临界干草叉分叉。该系统表现出理论上可预测的零交叉 ($β_c$),与网络的当前状态 ($β$) 相比,产生动态比率 $β(t)/β_c(t)$:表示动力学的通用、无标签相位坐标,完全可以从隐藏状态计算。我们根据经验验证了该坐标在不同设置中预测的四种不同的转换机制:语言模型 (Pythia)、SSL (CIFAR) 和 grokking(模块化算术)上的 SAE。至关重要的是,在有限耗散下,宏观对称性破缺可以使初始零交叉滞后几个数量级,这为在摸索中观察到的延迟逃逸提供了严格的动力学解释。从微观上看,分叉创造了一个共享的不稳定子空间,迫使集体对称性破缺。我们将其称为 SAE 训练中的“特征抽奖”:特征的最终可解释性很快就变得可预测。仅通过 5% 的训练,早期原子纯度就能可靠地预测最终的收敛纯度,前十分之一的早期原子在收敛时达到基线纯度的 12 倍以上。除了解释概念的出现之外,$β/β_c$ 还为训练健康状况提供了实用的预警指标,在下游指标做出反应之前检测可用结构的出现、特征身份的结晶以及表征崩溃时期。