论文

规模能把我们从大语言模型的可塑性丧失中拯救出来吗?

Can Scale Save Us From Plasticity Loss in Large Language Models?

模型评测模型行为与机制分析

摘要

可塑性丧失——网络在已学旧信息之后学习新信息的能力的丧失——是创建能持续学习的人工神经网络的根本挑战。虽然该现象已知晓数十年——但它大多在较旧、相对较小的架构中被研究——极少在自然语言域。为确定可塑性丧失在现代基于transformer的LLM范式中是否仍是问题——我们研究在多语言持续学习问题上训练的GPT式Transformer模型的可塑性丧失。与先前工作一致——我们发现在5M到314M非嵌入参数的模型中存在可塑性丧失的证据——以留出越南语探测任务上的退化度量。我们进一步发现可塑性丧失的起始遵循可预测的缩放律——随模型规模亚线性增长。这些结果提示更大模型可能延迟可塑性丧失的可测效应——但仅增加参数量可能不足以完全防止。我们还发现在平稳多语言训练下也有可塑性丧失的证据——挑战该现象为突变任务变化的持续学习所独有的观点。总体而言——我们的结果提示:即使大规模transformer语言模型——在足够长的训练后——无论持续还是平稳设定——终将失去高效适配新数据的能力。

规模能把我们从大语言模型的可塑性丧失中拯救出来吗?:论文配图
图 1:多语言持续学习问题。模型在八个语言建模任务实例的重复循环上进行训练。在每个周期结束时,使用越南的探测任务来评估可塑性。