论文
表达神经元循环网络的缩放法则和权衡
Scaling Laws and Tradeoffs in Recurrent Networks of Expressive Neurons
摘要
皮层神经元是复杂的、多时间尺度的处理器,连接到循环电路中,在严格的生物约束下受到长期进化压力的影响。相比之下,主流机器学习主要从极其简单的单元构建模型,这是从早期神经网络理论继承的默认设置。我们将其视为一个规范的架构问题。应如何在单元数量 $N$、每单元有效复杂度 $k_e$ 和每单元连接性 $k_c$ 之间划分固定参数预算 $P$?是什么控制着最优分配?这就需要一个模型,其中每个单元的复杂性可以独立于宽度和连接性进行调整。因此,我们引入了 ELM 网络,其循环层由表达泄漏记忆 (ELM) 神经元构建,选择用于反映皮质神经元的功能组件。该架构允许单独调整 $N$、$k_e$ 和 $k_c$,并在规模上稳定地进行多个数量级的训练。我们在两个性质不同的序列基准上评估模型:神经形态 SHD 添加任务和 Enwik8 字符级语言建模。性能沿着三个轴分别单调提高。在固定预算下,在它们的权衡中出现了一个明显的、不平凡的最优方案,更大的预算有利于越来越复杂的神经元。封闭式信息理论模型捕获了这些权衡,并将两端的收益递减归因于:每个神经元的信噪比饱和度和跨神经元的冗余度。跨可训练参数三个数量级的超参数扫描跟踪与框架一致的近帕累托前沿缩放定律。这表明,一旦探索了这个权衡面,机器学习中的简单单元默认值显然并不是最优的,并且为皮层对复杂时空积分器的依赖提供了一个规范的视角。