论文

在单个注意力层内引入梯度提升以修正预测误差

Gradient Boosting within a Single Attention Layer

模型架构Transformer

摘要

Transformer注意力对值进行一次softmax加权平均,无法修正自身估计误差。本文在单个注意力层内引入梯度提升:第二轮注意力使用独立学习的投影,关注第一轮预测误差,再施加门控修正。在平方重建目标下,这对应Friedman梯度提升机,每轮注意力是基础学习器,各维度门控是收缩参数。理论分析显示,单次Hopfield式更新会抹去与存储模式子空间正交的查询信息,局部收缩下继续迭代可使不同查询收敛到同一固定点;独立校正投影则可恢复Tukey二次估计共享投影未能获取的残差信息。WikiText-103和OpenWebText各千万词元子集上,测试困惑度比标准注意力改善6.0%和5.6%,优于Twicing Attention与参数匹配的更宽基线,两轮获得大部分收益。该机制依赖Pre-LN Transformer的加性残差结构;在Post-LN下,同样结构使困惑度恶化9.6%。