论文

线性注意力的海马体:为循环状态所遗忘者提供精确记忆

A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets

模型架构混合架构

摘要

线性注意力与状态空间语言模型将前缀压缩为固定大小循环状态——以有损的精确记忆为代价获得O(1)内存:当许多键值关联竞争时较早的事实被覆写、大海捞针式召回退化。受互补学习系统启发,我们给线性注意力一个海马体补充。HOLA(海马体线性注意力)保留常规delta规则状态作为压缩记忆——并添加有界精确KV缓存——形成半参数化测试时记忆:状态建模线性可压缩结构——而缓存存储不应被迫通过该状态的关联。缓存写入无需学习到的驱逐模块——保留β·||e||大的token——即实际提交给状态的预测残差;解耦的RMSNorm-γ缓存读取将这些精确KV对转变为锐利检索而非软平均。在15B SlimPajama token训练的340M参数上:HOLA将Wikitext困惑度从27.32降至22.92(-16.1%)——低于完整注意力Transformer++(26.88)——并将LAMBADA困惑度从30.95改善到30.26。它还取得最佳线性上下文检索——并在RULER大海捞针召回上远比GDN或匹配的HOLA+新近缓存稳健——直至32k token(训练长度的16倍)。