论文

弃权和噪声过滤:Softmax Attention 的两个缺失原语

Abstention and Noise Filtering: Two Missing Primitives of Softmax Attention

模型架构Transformer

摘要

据报道,控制注意力的价值路径可以改善语言模型预训练,但之前的研究对其原因存在分歧。我们争论并提供了实验证据,证明这样的门提供了 softmax 注意力所缺乏的两个不同的东西:弃权和噪声过滤。第一个是弃权,它允许注意力头不输出任何内容,绕过注意力权重必须总和为 1 的要求。第二个是噪声过滤,它允许注意力头的价值路径抑制残差流中叠加特征的干扰。在我们对 10M 到 350M 参数的匹配模型进行的实验中,我们通过 softmax 中学习的每头接收器 logit 提供弃权,并通过每个值的门进行噪声过滤。我们报告了三项实证研究结果。首先,弃权的好处(以验证损失相对于匹配基线的减少来衡量)随着模型的增长而下降,而噪声过滤的好处则随着规模的扩大而增加。特别是,弃权几乎占了 10M 选通和 350M 过滤的大部分增益。其次,每个尺度的最佳模型都是内置了两种基元的模型。第三,向头部读取的值注入受控干扰,证实门消除了此类干扰,并揭示了我们研究的两种门形式中的每一种都具有特征盲点。提供这两个原语会增加可忽略不计的参数,并且与键值缓存保持兼容。