论文
竞争下Self-Attention的检索能力
Retrieval Capacity of Self-Attention Under Competition
摘要
语言模型实际使用了多少个上下文中的标记,这个数字由什么决定?我们通过自注意力来研究这个问题。在不进行重新训练的情况下,我们只保留每个头、层和查询处具有最高注意力权重的标记,保持其原始权重不变。通过改变选定的集合大小并测量负对数似然(NLL)的增加,我们估计保持在选定的损失容限内所需的有效注意力集合大小。相对较小的选定集可以使 NLL 接近全注意力基线,尽管所需的大小因模型而异。基于注意力的选择大大优于随机选择。选定的集合表现出几何结构,尽管几何分离本身并不能证明模型损失得到保留。在评估相同预测目标的同时扩展上下文会增加所需的集合大小,而其上下文比例在测试范围内会减少。使用固定支持事实的实验表明,额外的背景会将其标记推低注意力排名并减少其注意力质量。重新规范化保留的权重可以大大减少所需的集合大小,这表明它还取决于所选表示的组合方式。条件理论模型解释了竞争和注意力集中如何在没有更多明确信息可供检索的情况下产生不断增长的集合大小。这些结果提供了一种测量语言模型中有效注意力集大小并研究其对上下文、竞争和聚合的依赖性的方法。