Daedalus-150M:专为 CPU 推理而设计的卷积注意力混合模型
Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference
摘要
小语言模型通常像大语言模型一样构建,然后压缩到 CPU 上。我们做了相反的事情:我们首先固定目标,一个用户,一次一个词元,4位权重,普通CPU,并选择适合它的架构。结果仅 18 个区块中的 6 个区块受到了充分关注。另外 12 个使用短卷积,无论对话持续多久,其内存都是两个时间步宽,因此网络的三分之二永远不会重新读取不断增长的缓存。该模型在 59.9B 词元上从头开始训练,在五项任务基准上得分为 47.31,而训练开始前固定的得分为 42.20。它击败了 GPT-2 124M、Pythia-160M、OPT-125M 和 GPT-neo-125M,所有这些都经过三到六倍的数据训练,并且超过了 MobileLLM-125M 发布的分数,尽管该模型看到了 1 万亿个词元。每字节验证位数为 0.8685。为了检查架构而不是训练方法,我们在相同的数据上训练了相同大小的传统全注意力模型,并在评分之前写下了获胜条件。该混合模型以 0.81% 的优势赢得了所选的质量指标,在下游任务中与之匹配,生成了小 6.3% 的 4 位文件,在 2048 个上下文标记下解码速度提高了 1.76 倍,与类似大小的外部模型相比,解码速度提高了 2.08 倍。在每次测量中,在空环境下速度优势都接近于零,并且随着长度的增加而增长,这是机制所预测的,而仅仅更精简的模型不会显示出这一点。简单的带宽计算预测仅为 1.17 倍,因此内存容量本身并不能解释这一差距。我们还报告了无效的内容:完全的 4 位质量成本、大约一半的卷积通道最终变得惰性且无法删除,以及大于此模型大小的词汇表。