论文

SLASH the Sink:锐化LLM内部的结构注意力

SLASH the Sink: Sharpening Structural Attention Inside LLMs

模型架构Transformer

摘要

大语言模型(LLM)展现出卓越的语义理解能力,但在处理以序列化格式呈现的图拓扑时常常难以实现结构理解。现有方案依赖训练外部图适配器或微调,成本高昂且损失泛化性。本工作考察LLM的内部机制并给出一个关键发现:LLM会在内部自发重建图的拓扑,证据是其注意力图中出现一种独特的"锯齿"模式,在结构上与"词元级邻接矩阵"对齐。然而,这种内在的结构理解会被注意力汇(attention sink)稀释。我们从理论上将这种稀释形式化为一种表示瓶颈,它源于一个根本冲突:对语言任务至关重要的模型各向异性偏置,抑制了图推理所需的拓扑感知局部聚合。为此,我们提出一种免训练方案,名为StructuraL Attention SHarpening(SLASH),通过即插即用的注意力重分配来放大这种内在结构理解。在纯图任务与分子预测上的实验验证了SLASH能在多种LLM上带来显著且一致的性能提升。

SLASH the Sink:锐化LLM内部的结构注意力
图 2:内部图重建的机制证据。 (a) 输入图。 (b) 内部拓扑重建:真实结构(标记级 M g t M_{gt} 和节点邻接)与其注意力衍生的对应结构(锯齿图案和重建邻接)的比较。 (c) 完整的注意力图。 (d) 注意力预算:汇偏差、结构聚合和噪音的比例细分。