论文

词汇扰动扰乱 LLM 推理:注意力转移的实证研究

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 实现了强大的推理性能,但它们对现实词汇损坏的鲁棒性仍然知之甚少。我们在键盘噪音、字符交换和填充插入的情况下,在四个推理基准上评估了四个开放权重指令调整模型和前沿模型。字符级扰动会大大降低准确性,尤其是在多步骤推理任务上,而填充插入几乎没有影响。我们将这种不对称性追溯到注意力转移:词汇损坏片段子词标记化,并且由此产生的片段吸引了不成比例的注意力质量,集中在中间和最后的 Transformer 层。长度匹配的控制确认了造成损失的是碎片,而不是提示长度。然后,阶乘干预说明了为什么损害难以挽回:碎片会同时破坏词元内容和注意力分配,并且两者是耦合的。在内容仍然损坏的情况下恢复干净的注意力是非常有害的,仅恢复内容是不够的,只有恢复两者才能弥补大部分差距。这种耦合解释了为什么推理时策略(包括思路提示、拼写检查、自我修复和更强的修复模型)无法一致地恢复性能:每种策略一次处理一个通道。代码和数据可在 https://github.com/Jiaqian-Janelle/Attention-Diversion 获取