论文
规模能把我们从大语言模型的可塑性丧失中拯救出来吗?
Can Scale Save Us From Plasticity Loss in Large Language Models?
摘要
可塑性丧失——网络在已学旧信息之后学习新信息的能力的丧失——是创建能持续学习的人工神经网络的根本挑战。虽然该现象已知晓数十年——但它大多在较旧、相对较小的架构中被研究——极少在自然语言域。为确定可塑性丧失在现代基于transformer的LLM范式中是否仍是问题——我们研究在多语言持续学习问题上训练的GPT式Transformer模型的可塑性丧失。与先前工作一致——我们发现在5M到314M非嵌入参数的模型中存在可塑性丧失的证据——以留出越南语探测任务上的退化度量。我们进一步发现可塑性丧失的起始遵循可预测的缩放律——随模型规模亚线性增长。这些结果提示更大模型可能延迟可塑性丧失的可测效应——但仅增加参数量可能不足以完全防止。我们还发现在平稳多语言训练下也有可塑性丧失的证据——挑战该现象为突变任务变化的持续学习所独有的观点。总体而言——我们的结果提示:即使大规模transformer语言模型——在足够长的训练后——无论持续还是平稳设定——终将失去高效适配新数据的能力。
