论文

Echo:使用 Spectral Koopman 运算符进行 KV-Cache-Free 关联召回

Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators

模型架构混合架构

摘要

长链思维推理和代理工具调用会产生跨越数万个词元的跟踪,但 Transformer KV 缓存会随着序列长度线性增长,从而在商用硬件上造成内存瓶颈。状态空间模型提供恒定的内存循环,但会遇到内存悬崖:一旦存储的事实与其查询之间的差距超过循环状态的有效范围,检索精度就会崩溃。我们引入了 Echo,一种基于 Spectral Koopman Attention (SKA) 构建的无 KV 缓存的关联召回架构;注意力层的直接替代品,使用封闭式动态算子增强 SSM 块,其足够的统计数据累积在没有 KV 缓存的常量内存中。 Echo 通过核岭回归将谱线性系统拟合到键和值历史记录,并通过学习的功率迭代滤波器进行检索,所有这些都来自 $O(r^{2})$ 流状态,其中 $r$ 是一个小的投影等级。在多查询关联召回基准上,纯 Mamba-2 SSM 在所有间隙长度和 KV 对计数上都未能超过机会精度 (${\sim}3\%$),而在 50M 参数规模下,SKA 增强模型在每个测试配置上实现了 $100\%$ 检索精度,包括 $4{,}096$ 词元与 $32$ KV 对的干扰间隙。在五个额外的传输基准测试中,包括大海捞针、工具跟踪和多跳检索,SKA 始终优于纯 SSM 和 SSM+Attention 混合模型,同时保持恒定的推理记忆。消融证实了谱算子,而不是前缀掩蔽策略,驱动了检索增益。