论文

注意力敏感性还不够:微调 下的注意力水平与行为情境学习的分离

Attention Sensitivity Is Not Enough: Dissociating Attention-Level and Behavioural In-Context Learning under Fine-Tuning

模型评测模型行为与机制分析

摘要

情境学习 (ICL) 让 大语言模型 适应演示中的新任务,而 微调 可以消除这种行为。许多保存诊断检查注意力:如果注意力随着演示的变化而变化,则该模型被视为上下文相关的。本文询问代理经过优化后可以在多大程度上受到信任。我们形式化了 \emph{In-Context Sensitivity} (ICS),即匹配和不匹配的演示前缀上最后一个标记注意力之间的平均行距离,并将其与 \emph{ICL-GAP}(相同前缀之间的行为准确性差距)配对。在 Llama-2-7B 上的受控四臂消融中,ICS 最大化正则化器 ($\armKL$) 将 ICS 驱动至 $1.413$,距其几何上限 $0.5\%$ 以内。行为读数讲述了一个不同的故事:ICL-GAP 保持在接近零的水平,MMLU 准确度从 $0.371$ 移动到 $0.279$,这是有限注意力代理的 Goodhart 分离。端点统计数据定位了机制:注意力在前缀之间变得尖锐且几乎脱节,但路由到格式化和演示主体标记而不是标签。随机标签协议确认行为探针系列在相同检查点保留动态范围。在建设性扫描中,行为门控部分减轻了影响,而锚定到预训练计算的目标则保留了发散最大化者留下的高 MMLU、中等 ICS 区域。主要的教训是诊断:只有在针对行为差距进行验证后,注意力水平 ICL 代理才能赢得训练目标的地位。