论文
多头注意力中 Token 选择的几何分析
Geometric Analysis of Token Selection in Multi-Head Attention
摘要
我们提出了一个用于分析大语言模型(LLM)多头注意力的几何框架。在不改变机制本身的情况下,我们以 top-N 选择的视角审视标准注意力,并直接在 value 态空间中研究其行为。我们定义几何指标——精确率(Precision)、召回率(Recall)与 F 分数——来量化被选与未选 token 之间的可分性,并在有经验依据的假设(稳定的 value 范数与被压缩的 sink token、相似度的指数衰减、分段式注意力权重轮廓)下,推导出对维度与间隔有显式依赖的非渐近界。该理论预测存在一个小 N 的运行区间,其中非平凡可分性最强,并阐明了序列长度与 sink 相似度如何塑造这些指标。在实证上,跨 LLaMA-2-7B、Gemma-7B 与 Mistral-7B 的测量紧密贴合理论包络:top-N 选择使可分性更锐利,sink 相似度与 Recall 相关。我们还发现 LLaMA-2-7B 中的注意力头专门化为三种模式——Retriever、Mixer、Reset——具有不同的几何特征。总体而言,注意力表现为一个结构化的几何分类器,其 token 选择具有可测量的判据,为 LLM 提供注意力头层面的可解释性,并为几何感知的稀疏化与 LLM 注意力设计提供参考。
