论文

超越序列顺序:Transformer 的语法通知位置嵌入

Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers

模型架构Transformer

摘要

Transformer 中的位置嵌入(PE)编码标记距离和顺序,但很大程度上与 \textit{句法结构} 无关。我们引入了 \textbf{S}yntax-\textbf{i}nformed \textbf{P}ositional \textbf{E}mbeddings (\textbf{SiPE}),它在预训练期间从依赖解析中学习轻量级语法先验,并将其注入到所有三个主要 PE 系列(绝对、相对、旋转)中,对于编码器和解码器来说,使自注意力和架构的其余部分保持不变。我们隔离了 \emph{where} 和 \emph{how} 先验应该进入模型,并发现它取决于架构:对于使用相对 PE 的自回归解码器,先验在与注意力分数的相对位置项乘法耦合时最强,优于注入输入嵌入、自注意力或联合注入位置和注意力项——而对于编码器来说,最好直接添加到输入嵌入,与每个编码器的本机位置机制。我们发现,使用 SiPE 预训练的模型在 SyntaxGym 基准上提高了高达 10.3\%$,同时与没有语法监督的基本模型相比,困惑度降低了 9.0\%$——几乎所有现有语法注入方法都会降低这一指标。至关重要的是,这些收益超出了句法泛化范围:SiPE 还提高了现实世界的语言理解,与没有使用 SiPE 训练的模型相比,在 GLUE 基准上的得分提高了 8.2%$。与在推理时边缘化许多解析或在运行时丢弃语法的现有句法语言模型不同,SiPE 以单个解析为条件,在句法监督和推理成本之间建立新的帕累托边界。