论文
注意力功能作为一种内在的归纳偏差:模型的行为如何在新的环境中发散
Attention Function as an Intrinsic Inductive Bias: How Models' Behavior Diverges in Novel Contexts
摘要
发展心理学认为,某些先验是在经验之前给予婴儿的,而不是从数据中归纳出来的,并且这种先验的影响在强的、约束良好的条件下受到抑制,但在弱的条件下会重新发挥作用。我们问类似的原理是否适用于 Transformer:赋予注意力头的激活函数可以充当内在的归纳偏差吗?我们提出了混合函数注意力(MoFA),这是一种对多头注意力的无参数修改,在训练前固定了 softmax 和 sigmoid 头的比例。在五个比率、一个 124M 参数的 GPT-2 模型和五个种子中,我们发现这个给定的比率对分布影响很小——对于中等混合,比率之间的差异在统计上可以忽略不计,即使在极端情况下也仍然很小——但在 15 个分布外域的零样本分布偏移下,其影响力会急剧重新出现。在多个领域中,比率之间的困惑度差距扩大了一个数量级以上,并且表现最佳的比率跟踪领域结构的单个轴,将短的非正式文本(softmax-favoring)与技术性的长格式文本(sigmoid-favoring)分开,这解释了领域响应中78.3%的方差。这种重组在头部层面是可见的:随着比率的增加,sigmoid 头部的注意力熵会加速下降,而 softmax 头部的反应则更为温和,从而在两种头部类型之间产生一致的分工。我们的结果表明,激活选择作为给定的先验函数,其影响在分布内被掩盖,并在分布外重新出现。