论文

新的注意力机制真的能解决百万词元上下文中的注意力沉没问题吗?

Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?

模型评测模型行为与机制分析

摘要

长上下文语言模型现在宣传一百万个词元的窗口,但是有两个习惯限制了该窗口的使用量。没有什么有用的阅读内容的注意力头仍然将预算花在第一个标记上,这被称为注意力接收器,无论模型找到它,事实在上下文中的位置都会改变。在 NeurIPS 2025 上,门控注意力将首次词元注意力从 46.7% 削减至 4.8%,而 Kimi K3 将这一想法与 100 万个词元窗口后面的 Kimi Delta Attention 和注意力残差结合起来,是这些诊断报告范围的八倍。本文询问修复是否能在这次跳跃中幸存下来。我们构建了 SinkProbe,这是一个测量接收器质量、大规模激活、位置解析召回和新近度差距的套件,并将其应用于四个小模型,这些模型的不同之处仅在于它们混合标记和深度的方式。以下是三个结果。训练目标产生水槽,而不是架构。门控并没有在我们的规模上再现其已发表的效果。汇质量、激活和位置偏差独立移动。代码、数据和测量协议发布于 https://github.com/saraizwan7/Attention-Mechanisms-in-1M-Context-Window