论文

通过注意力头重新加权实现 LLM 的数据高效适应

Data-Efficient Adaptation of LLMs via Attention Head Reweighting

模型训练参数高效训练

摘要

在安全等标记示例稀缺的领域,从有限的数据中有效地学习至关重要。 大语言模型 (LLM) 已经展示了一些数据高效学习的能力,特别是通过参数高效的适应方法,但在面对困难任务的样本较少时继续挣扎。为了应对这一挑战,我们提出了注意力头重新加权(AHR),这是一种数据高效的方法,通过仅学习每个注意力头的单个标量,使 LLM 适应新的文本分类任务。这大大减少了需要通过利用个体注意力头的功能专门化来学习的参数数量。对各种开源文本分类数据集的实验表明,尽管可训练参数少了 200-1000 倍,但在从有限样本中学习时,AHR 的性能仍优于 LoRA 等标准基线,因为我们的 AHR 仅修改了约 0.0001% 的模型参数。此外,我们学习到的权重很容易解释,可以进行分析,以更好地理解 LLM 中负责上下文学习能力的机制和注意力头。