论文
不要阅读所有内容:线性注意力的曲率条件查询
Don't Read Everything: A Curvature-Conditioned Query for Linear Attention
摘要
线性注意力通过维持循环的快速权重状态来降低 softmax 注意力的二次成本,但它始终落后于上下文检索和长上下文任务。现有的补救措施通过门控、增量更新或内核特征映射作用于内存的写入侧,但读取步骤保持不变:每个过去的密钥都会对输出产生附加贡献,因此有用的目标会被大量存储的向量稀释。我们借用了 softmax 几何的一个特定部分来构建查询的廉价读取时间压缩。各向同性注意点处的 softmax 对数分区的二阶泰勒展开给出了一个局部二次模型,其曲率与运行键协方差一致,该量可以使用与线性注意状态相同的循环/分块机制来维护。关联的线性运算符在读取状态之前沿着内存的高方差方向收缩查询。我们将这种机制称为曲率条件查询(CCQ)。 CCQ 仅修改读取步骤,并且可与任何线性注意力主干组合。附加到 GLA 和门控 DeltaNet,它提高了困惑度、零样本下游精度、训练环境内外的 S-NIAH 检索、从 4K 到 20K 的长度外推困惑度以及 LongBench 精度。