论文

注意力退化、功能词元锚定与基于注意力干预的极限

Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models

模型评测模型行为与机制分析

摘要

跨位置平均注意力退化在Transformer可解释性中被广泛报告,但它是否在因果上限制上下文检索仍未被检验。我们在GPT-2、LLaMA-3.2-1B/3B、OPT-1.3B与distilgpt2上呈现六项协调实验。首先刻画短期(5–100 token)注意力退化:普遍呈指数后平台模式,速率与深度负相关,各架构有独特的分层熵签名。功能词元锚定证明架构依赖:OPT-1.3B(绝对位置编码)显示距离依赖的介词特异性,GPT-2显示均匀非特异依赖,LLaMA(RoPE)在长距离出现反转。在从句边界策略性插入逗号在40–80 token范围内因果地降低预测退化,其收益系于句法边界对齐而非token密度。随后我们因果检验该机制:把注意力logits偏向功能词元位置的Relay-Aware Attention(RAA)可验证地把注意力质量提高16–24%,却在GPT-2与LLaMA-1B上产生零效应、在LLaMA-3B上有初步损害、在OPT-1.3B上净效应约为零。多事实检索探针进一步显示退化率不能跨模型预测检索准确率。我们 conclude:平均注意力退化在很大程度上是描述性而非规定性的——功能词元经由其隐状态计算什么做贡献,而非经由它们获得的注意力。这对可解释性方法论与基于注意力分数的推理优化(如KV缓存逐出)都有含义。