论文

学习在资源限制下微调基础模型

Learning to Fine-tune Foundation Models under Resource Limitations

模型训练参数高效训练

摘要

我们研究了部署在资源有限设备上的预训练基础模型的最优连续 微调 问题。在每个时隙,一批新的训练数据到达,控制器面临两个选择:要么使用数据微调模型并产生计算成本,要么不微调模型并丢弃数据。做出决定后,将根据特定于应用程序的性能指标(例如分类准确性)来衡量当前模型的性能。我们的目标是学习一种最优策略,该策略在有限的计算预算下确定单个任务(例如情绪分析)的 \emph{何时微调模型}。我们将这个在线决策问题表述为约束马尔可夫决策过程,其中系统状态捕获三个基本方面:(\textit{i}) 模型的性能、(\textit{ii}) 计算预算和 (\textit{iii}) 与迄今为止遇到的历史数据的数据分布相关性。到下一个状态的转换是随机的,因此,我们提出了一种基于强化学习的方法来解决这个问题,即 \emph{actor-critic} 算法。我们还考虑了特殊情况,即可以在决策之前预测或估计给定模型的 微调 的性能;在这种情况下,问题就变成了动态规划问题。在广泛使用的文本分类数据集上使用大型预训练模型进行的实验表明,我们的方法在准确度方面始终优于具有相同计算预算的 微调 方法超过 $4\%$,并实现了 $97\%$ 的全参数 微调 准确度,同时仅需要 $25\%$ 的 微调 步骤。