论文
群中涌现的分层单义神经元-对比前向-前向算法
Emergent Hierarchical Monosemantic Neurons from the Group-Contrastive Forward-Forward Algorithm
摘要
以稀疏字典学习(SDL)方法(最突出的是稀疏自动编码器)作为中心范例,机械可解释性在理解神经网络表示方面取得了重大进展。然而,最近的工作报告了这种范式的一些局限性:SDL 目标是不可识别的; SDL 方法严重依赖于线性表示假设;越来越多的证据表明概念是非线性编码的,因此不能用任何单一方向来表达。我们假设存在一条不同的通向单一语义的途径。生物视觉系统表现出高度选择性的神经元,它们被组织成越来越抽象的层次结构,并且这种组织是从局部的、分层的学习规则中产生的,而不是从全局错误信号中产生的;因此,我们要问,生物学上合理的学习算法是否同样会产生单义神经元。为了测试这一点,我们提出了组对比前向前向(GCFF),这是一种前向前向训练算法,它将类特定路由与类内对比目标相结合,通过架构约束而不是稀疏性达到单语义性。由于 GCFF 将多个非线性层附加到所研究的表示上,因此它的神经元可以捕获非线性概念。在 CLIP 表示上,单个经过训练的 GCFF 模块可恢复单语义神经元,其抽象随着深度逐渐增加,达到独立于图像前景的环境属性,而无需任何稀疏性约束或抽象级别的监督。我们进一步证明 GCFF 可以从头开始训练网络,在各种图像分类基准上实现前向算法中最先进的性能。