论文

创造下沉的不是 RoPE:自我集中和价值非混合在注意力中的作用

It's Not RoPE that Creates Sinks: The Role of Self-Concentration and Value-Non-Mixing in Attention

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 通常在序列的初始位置表现出“注意力沉降”(AS) 和伴随的“大规模激活”(MA)。这些现象经常同时出现,MA 可能会给低比特量化带来挑战。在本研究中,我们分析了在初始位置出现的 AS 和 MA 的潜在因素,无论词元占据该位置如何。我们的实验表明,由因果掩模引起的注意力的自我集中,以及随后注意力输出中的价值非混合有助于 AS 和 MA。这些发现为 LLM 的内部动态提供了新的经验证据,提供了可能为未来量化策略提供信息的见解,并促进我们对注意力层内部机制的理解。