论文

实现线性化的关键:分析驱动的 Transformer 线性化

The Key to Going Linear: Analysis-Driven Transformer Linearization

模型架构Transformer

摘要

因果自注意力的二次成本严重阻碍了长上下文 Transformer 推理。尽管存在大量事后线性化管道,但很难确定哪些组件可以保持模型质量。这项工作在严格的冻结主干机制中隔离了状态更新设计的影响。我们证明了 softmax 依赖于 key-dependent、rank-1 正交投影,阐明了为什么 delta 式网络优于纯门控累积。我们确定了近似误差的潜在来源,并引入了结构干预措施,特别是接收器词元、短卷积和固定预算缓存路由,从而减少了剩余差距。我们将这种跨 LLaMA 和 Qwen 模型的线性化方法扩展至 32B 参数,优于 MMLU 上的先前事后基线,并匹配复杂自适应缓存框架的长上下文检索。