论文

CARVE:内容感知循环,具有块并行线性注意力的价值效率

CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention

摘要

循环 delta 规则模型保留一个固定大小的状态矩阵 S (d_v x d_k),用于压缩所有过去的上下文。最先进的技术 (GDN-2) 使用逐元素矩阵擦除/写入掩码来控制此更新。这很强大,但有两个缺陷。首先,两个门都是根据传入的词元单独计算的,这使得模型是内存盲的:它决定删除什么,而不查看它存储的内容。其次,擦除门中的值轴耦合会阻碍驱动高效训练的 WY 形式三角形块求解器——块内系统分裂为 d_v 独立求解,从而将吞吐量压缩为串行循环成本。我们引入了 CARVE(具有价值效率的内容感知循环),它修复了这两个问题,并且通过相同 WY 形式数学的单次启动“megkernel”调度,训练速度比它所取代的矩阵门控基线更快。关键思想是架构性的:将所有选通限制在关键轴上,使块内耦合独立于值索引,恢复一个未修改的 WY 形式求解。在此约束内,CARVE 将两个门都置于从块边界状态中每个块读取一次的内容信号上,并以代数方式折叠到每个门的低秩投影中(通过关联性,U(Sq)=(US)q),以可忽略的额外流量提供内存感知门控。在初始化时,内容投影为零,因此 CARVE 与基线位相同;我们证明单块陈旧性仅对门产生 O(1/sqrt(L)) 扰动,与测量到的 0.18% 偏差相匹配,直至 L=128。在 H100 上的 1.3B 参数/100B FineWeb-Edu 词元(三个种子)上,CARVE 改进了每个轴:WikiText 困惑度 15.72 比 15.90(混合 15.41 比 15.62)、+0.63 pp 平均常识准确性、最先进的标尺和真实世界召回率 - 同时在匹配深度下训练速度加快 1.4%等质量深度下 +19.3%,峰值内存 +13%。有六项正式保证作为后盾。