论文

GQA 中的灵敏度-位置共定位 Transformer

Sensitivity-Positional Co-Localization in GQA Transformers

模型训练参数高效训练

摘要

我们研究了分组查询注意力(GQA)Transformer 中的一个基本结构问题:对任务正确性最敏感的层是否与位置编码适应具有最大影响力的层一致?我们将其称为共定位假设,并在 Llama 3.1 8B 上进行测试,Llama 3.1 8B 是一个 32 层 GQA 模型,查询与键值头比率为 4:1。我们引入了 \LSLORA,它将 LoRA 适应限制为通过新颖的正确性差异隐藏状态度量识别的层,以及 GARFA(GQA 感知 RoPE 频率适应),它将 8 个可学习的每 KV 头标量乘数附加到每个目标层。与共定位假设相反,我们发现了强烈的反定位:任务敏感层集中在后期网络($\ell\in\{23\text{-}31\}$),而 RoPE 影响层主导早期网络($\ell\in\{0\text{-}9\}$),产生 Spearman $r_s = -0.735$ ($p = 1.66\times10^{-6}$)。尽管存在这种反本地化,4 路跨层消融表明,在六个不同的基准(MMLU、GPQA、HumanEval+、MATH、MGSM、ARC)中,将两种干预措施应用于敏感度识别层,其性能优于所有替代配置 4-16 个百分点,在总计算成本为 100 美元的情况下,接近 HumanEval+ 上的 Claude 3.5 Haiku(67.1% 与 68.3%)。