论文
SpecLA:用于线性注意力模型的高效 推测解码
SpecLA: Efficient Speculative Decoding for Linear-Attention Models
摘要
线性注意力模型用循环状态取代了不断增长的 KV 缓存,但自回归解码仍然一次读取、更新和写入这些状态一个词元。 推测解码 可以通过在一次目标传递中验证多个草案词元来降低这一成本,但现有的推测系统是为 Transformer KV 缓存设计的。对于有状态的线性注意力目标,验证必须遵循跨链和分支的循环依赖关系,接受必须仅更新接受的状态轨迹,起草者必须避免提交浪费状态验证工作的候选者。本文提出了 SpecLA,这是一个用于状态线性注意力模型的 推测解码 运行时。 SpecLA 使用拓扑感知内核验证链和树,存储验证过程中生成的紧凑因子以恢复接受的状态,并使用置信度修剪和目标对齐的 EAGLE 风格绘图器向验证者提供有用的候选者。在具有公共 GDN-1.3B 目标的 NVIDIA H100 上,SpecLA 比自回归解码实现高达 1.70 倍的端到端加速。