论文

位置注意力头与符号注意力头:学习动态、RoPE 几何和长度泛化

Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

模型评测模型行为与机制分析

摘要

基于 Transformer 的语言模型在当今社会广泛存在。因此,了解它们解决结构化任务的机制并预测它们在新场景中的表现对于安全部署非常重要。我们通过在两个结构等效的多跳推理任务上训练仅解码器的 Transformer (GPT-J) 来研究受控环境中注意力头的学习动态:需要位置推理的数字任务和需要符号推理的字母任务。使用最近引入的指标,将注意力头行为分类为给定提示的位置或象征性行为,我们表明成功的学习与纯头的出现相关,即,将自己表达为位置或象征性的头。尽管任务的结构相同,但它们提出了不同的机械要求:数字任务需要位置和符号头部,而字母任务仅需要符号头部。然后,我们确定这些头的计算角色,描述它们实现的基本功能,并给出理论结构,展示基于单层 RoPE 的注意力如何通过几何可解释的查询、键和值操作来实现这些功能。该分析在位置机制和符号机制对较长序列的鲁棒性方面产生了定量分离,并通过新颖的差异概念形式化。我们在受控模型和现实世界模型中凭经验验证了所得预测,表明符号机制可以更可靠地推断更长的序列,而位置机制面临更尖锐的限制。