论文
注意力漂移:自回归 推测解码 模型学到了什么
Attention Drift: What Autoregressive Speculative Decoding Models Learn
摘要
推测解码 通过使用小模型起草未来词元来加速 LLM 推理,但起草者模型在模板扰动和长上下文输入下急剧退化。我们发现了一种以前未报告的现象,我们称之为 \textbf{注意力漂移}:当起草者在推测链中生成连续的标记时,注意力逐渐从提示转移到其自己最近生成的标记上。我们在 \emph{EAGLE3} 绘图仪和 \emph{MTP 头} 上观察到这一点,表明漂移是绘图仪设计的一个属性。我们将其追溯到链步骤之间的非标准化残差路径:绘图者的隐藏状态大小随着链深度单调增长,这表现出与堆叠在目标上的附加预规范 Transformer 层一致的动态,而不是作为独立的自回归预测器。为了限制增长,我们提出了两个架构更改:起草者隐藏状态的后规范和捕获目标隐藏状态后的每个隐藏状态 RMSNorm。我们的干预措施使当前领先模型(预规范 EAGLE3)的接受长度在模板扰动下提高了高达 $2\times$,在长上下文任务上提高了 $1.18\times$,在涵盖多轮聊天、数学和编码的七个标准基准上提高了 $1.10\times$。我们的更改还允许更短的训练时间测试深度来推广更长的绘图序列。