论文

明暗对比注意力:在黑暗中进行计算

Chiaroscuro Attention: Spending Compute in the Dark

模型架构Transformer

摘要

我们引入了CHIAR-Former(基于CHIAroscuro Attention的Transformer),这是一种高效的Transformer,它根据[0,1]中每个词元的谱熵H(x)将每个词元路由到DCT谱混合(O(d log d),次二次)或完全自注意力(O(n^2 d),序列长度n的二次),它测量每个词元嵌入 x 的频域复杂度。我们做出了三个贡献:(1)我们发现了路由崩溃——一个三算子系统崩溃为 DCT+Attention,揭示了最优算子子集; (2) 我们在 [0,1] 中提出了一个学习任务级 MetaRouter g = sigma(Linear(x-bar)),其中 x-bar 是批量均值嵌入,g 端到端地软混合频谱和身份路径; (3) 我们在 WikiText-103 上展示了 400M 参数下 FLOP 减少了 35-40%,PPL 成本为 3.93(测试 PPL 27.51 与 23.58)。在混合数据集训练下,CHIAR-Former 的性能显着优于小型语料库的完整注意力,证实了谱混合的正则化价值。 MetaRouter 稳定在 g ~ 0.22,表明模型在规模上达到了稳健的计算质量平衡:注意力层吸收了表征复杂性,而频谱预处理有效地锚定了低频结构。