论文

DyPAM:位置注意调制的参数高效微调

Dynamic Positional Attention Modulation for Parameter-Efficient Fine-Tuning of Large Language Models

模型训练参数高效训练

摘要

参数高效的微调(PEFT)已成为使大语言模型适应下游任务的标准方法。然而,大多数现有的 PEFT 方法依赖于统一和静态的适应,没有考虑跨维度、头、层和输入 token 的注意力的结构异质性。在实践中,注意力表示表现出不均匀的行为,并且诸如旋转位置嵌入(RoPE)之类的位置编码机制会导致依赖于维度的位置结构,从而使得均匀适应不是最佳的。在这项工作中,我们提出了 DyPAM(动态位置注意力调制),这是一种 PEFT 方法,通过直接操作查询和关键表示来调整位置信息对注意力的贡献方式。 DyPAM 将输入条件、维度调制与头向和分层结构调制相结合,执行与 RoPE 诱导结构对齐的位置注意力的细粒度适应,而无需修改预训练的 骨干模型。对多个 骨干模型 模型的数学和常识推理基准进行的广泛实验表明,DyPAM 始终优于现有的强大 PEFT 基准。

DyPAM:位置注意调制的参数高效微调:论文原图
图 3. DyPAM 框架的架构。 DyPAM 在 RoPE 之前将输入条件、维度调制以及头向和逐层结构偏差应用于查询和关键表示,从而实现 PEFT 范式内位置注意力的细粒度适应。