RoPE 是否会阻止或降低回收头性能?跨模型系列的机制分析
Does RoPE Prevent or Degrade Retrieval Heads? A Mechanistic Analysis Across Model Families
摘要
检索头(将信息从早期上下文复制到当前位置的注意头)已被提议作为长上下文回忆的机械基础。旋转位置嵌入 (RoPE) 通过随基本超参数 theta 衰减的频率来旋转查询和键,一个自然的假设是这种旋转要么阻止检索头形成,要么降低其功能。我们使用成对种子大海捞针测试、层聚类排列和因果头屏蔽,对四个开放权重 7-8B 模型进行了测试,涵盖多头和分组查询注意力以及 100 倍范围的 theta。 (i) 检索头是因果必要的:屏蔽 OLMo-2 中检测到的 87 个头会使召回率从 1.00 下降到 0.00,而屏蔽匹配的随机头则没有效果;这在 Qwen 中得到了复制。 (ii) 更高的 theta 不会减少检索头数量(LLaMA-3.1 在 theta=500K 时有 47 个头,而 LLaMA-2 在 theta=10K 时有 42 个头),反驳了预防假设。 (iii) 范数-效用关系是家庭特有的,并且在相反方向上显着(Qwen d=-0.49,OLMo d=+0.50,均显着;LLaMA 无效);由于 OLMo 和 LLaMA-3.1 共享 theta=500K 但有所不同,因此效果不是由 theta 驱动的。 (iv) 以Chiang和Yogatama(2025)为基础,一个受控补丁表明,将检索头的最低频率RoPE维度归零会剂量依赖性地降低召回率(当128个维度中的32个归零时,1.00至0.18,而随机维度为0.98);效果是针对头部和任务的。因果变量是 RoPE 频率,而不是常态效用。该方向适用于跨越四个谱系和两个尺度的所有五个修补模型(OLMo-2、Qwen2.5-7B/14B、Gemma-2、Mistral)。我们不主张跨模型的规模。代码和配对种子工具已发布。