论文

L1 增强注意力作为改进的向量相似度度量

L1 Augmented Attention as an Improved Vector Similarity Metric

模型架构Transformer

摘要

缩放点积注意力将方向对齐和矢量幅度混为一谈,限制了其作为 Transformer 模型中相似性度量的有效性。我们引入了 L1 增强注意力,这是一种简单且计算可并行的修改,可以从点积分数中减去查询和键之间学习的、头部特定的 L1 距离。这种混合相似性捕获了互补的几何信息。点积奖励方向对齐,而 L1 惩罚坐标偏差。为了降低 L1 计算的成本,我们将查询和键投影到低维子空间中,其参数专门用于保留信息丰富的 L1 结构。使用紧凑的 Transformer 在 WikiText 2 上进行评估,L1 增强注意力与原始 Transformer 基线相比,困惑度降低了 14.5%,并且优于 RBF L2 内核。对范数方差和学习到的 L1 权重的分析揭示了跨层的不同几何角色和强大的头部专业化。这些结果表明,利用 L1 几何丰富注意力为现代语言模型中的相似性计算提供了原则性且有效的改进,对准确性和并行效率都有实际好处。