论文
注意力中的缩放参数和上下文:来自 Mixture-of-Head 的原生稀疏注意力
Scaling Parameter and Context in Attention: Native Sparse Attention from Mixture-of-Head
摘要
扩展注意力参数可以提高语言模型的质量,但保留完整的标记历史会使额外的头在长上下文中成本高昂。此外,由于注意力检索并组合上下文信息,参数缩放还应该支持更长的上下文。因此,我们询问注意力参数缩放是否可以直接实现高效且有效的上下文缩放。我们引入 NAMOH,一种架构原生的稀疏注意力机制,可以激活每个 token 的 $K$ 个 $H$ 头。每个头仅保留其分配的标记,并在此子序列中执行因果注意。因此,头选择共同确定活动参数和可用上下文,而无需扫描完整历史记录。在平衡分配下,以固定的 $K$ 增加 $H$ 可以缩短头部历史并减少每个词元的键值 (KV) 访问,而无需增加总 KV 存储。我们进一步支持头部相对旋转位置嵌入,以缩短路由子序列内的位置跨度,旨在减轻位置引起的注意力噪声。实验表明,NAMOH 可以优于具有相同总参数的完全激活模型,同时比具有匹配的活动参数计数的较小密集模型能够实现更高效的长上下文推理。它仍然与 GQA 和现有的稀疏注意力机制兼容。我们希望这项工作为扩展注意力提供一条新途径,通过参数扩展直接实现上下文扩展。