论文

结构性注意力税:检索格式如何劫持独立于内容的情境学习

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

上下文与知识检索增强

摘要

检索增强生成(RAG)系统注入外部知识来改进 LLM 输出,但注入内容的格式(与其语义相关性不同)可以独立地扭曲模型的注意力分布。我们识别并形式化了一种称为结构注意力税的现象:知识图(KG)三元组,由于其关系分隔符和重复的槽模式,每个标记捕获的注意力比语义上等效的自然语言文本多 2-3 倍($\hat{o}$(KG) $\approx$ 0.70 vs. $\hat{o}$(neutral) $\approx$ 0.25),将演示注意力压缩高达42%——无论三元组是否相关或噪音。我们开发了一个正式框架,将注意力分数分解为语义和结构成分(等式 2),推导出一个压缩界限(命题 1),将 词元级 格式偏差与演示注意力损失联系起来,并表明结构项控制注意力转移的程度,而语义项控制这是否有帮助或有害。这种解耦揭示了改善检索增强 ICL 的两个正交轴:优化检索质量(语义轴)和减少格式驱动的注意力捕获(结构轴)。根据经验,在两个模型系列(Mistral-7B、LLaMA-3-8B)和三个 QA 基准测试中,我们观察到源-任务对齐占主导地位:任务匹配的 BM25 检索在 HotpotQA 上实现了 58-62%,而 ConceptNet 为 25-27%,>30 pp 的差距使所有门控策略相形见绌($\leq$2 pp)。我们从该框架中得出了五种结构感知缓解策略,从零成本即时修改到训练时间正则化;格式扁平化(S3)通过言语三重控制的准确性和注意力水平证据进行了验证,而结构分散(S1)产生了混合结果,阐明了格式级别干预的挑战。