论文

通往中间的两条路线:分班搜索和大脑读数集中在持续学习者应该专注的领域

Two Routes to the Middle: Placement Search and Brain Readouts Converge on Where Continual Learners Should Specialize

模型训练持续学习

摘要

持续学习者在预先训练的视觉转换器的每个块中保留一个特定于任务的适配器,随着任务数量线性累积存储空间;将特定于任务的适配器保留在几个块中可以抑制这种增长,但提出了将它们放置在哪里的问题。我们从两个角度来探讨这个问题。从算法上讲,训练所有连续的四块放置会产生倒 U:最终准确度在中间深度达到峰值,变化幅度高达 3.5 个百分点 (pp),而基于权重谱或激活统计的廉价标准有利于最深的块。从神经科学的角度来看,视觉皮层的分层组织和中期可塑性促使我们思考,在学习者外部进行的测量是否可以在无需位置搜索的情况下指导层专业化。 LS-B 通过 12 个人类视觉区域的冻结功能磁共振成像编码模型观察第一个任务,并将特定于任务的能力一次提交给那些其读数相对于其稳定结构在任务中变化最大的块。在三个 ViT-B/16 主干网中,LS-B 产生稳定的、特定于主干网的分配。在具有布局搜索的两个主干网络 AugReg 和 iBOT 上,所选块与搜索识别的中间深度区域重叠。在匹配的存储和观察预算下,所选块的性能优于最浅和最深的四块配置。在 Split ImageNet-R 上,LS-B 使用了 60% 的全 BiLoRA 适配器存储,同时保持在其最终精度的 1.5 pp 以内。该分配不需要标签或反向传播,运行时间增加不到 0.6%,并表现出骨干网特定的皮质签名。