论文
泰勒校准:混合线性注意力的原则初始化 蒸馏
Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation
摘要
混合线性注意力模型为更快的长上下文推理提供了一条有吸引力的途径:它们减少了完全 softmax 注意力的二次成本和 KV 缓存负担,同时保留了 Transformer 模型的大部分质量。获得此类模型的一种实用方法是转换预训练的 Transformer,而不是从头开始预训练新的架构,但这种转换仍然很脆弱。简单地将教师注意力投影复制到门控 DeltaNet (GDN) 学生中并不会指定新的循环衰减、写入和输出门控动态。因此,转换后的模型通常以较差的动态状态开始,并且必须花费许多 蒸馏 词元来修复初始化,而不是学习剩余的教师行为。我们提出了 Taylor-Calibrate,这是一种针对混合 GDN 学生的轻量级初始化方法。该方法使用泰勒引导的教师注意力统计来设置值投影、内存时间尺度、写入门和输出门,然后应用短的每层对齐步骤将每个转换层与教师输出进行匹配。在四种教师设置和三种保留层策略中,Taylor-Calibrate 为零样本学生提供了更强的能力,代表性消融提高了 88 倍,并达到了匹配的恢复目标,而训练词元比朴素转换少了 4.9 倍--9.2 倍。