论文
为大语言模型加入轻量逐通道卷积
Convolution for Large Language Models
摘要
大语言模型(LLM)很大程度上依赖于Transformer,其中自注意力提供全局词元交互,但没有显式编码自然语言的局部性。我们研究轻量级逐通道卷积是否可以在不大幅增加模型大小的情况下提供这种局部归纳偏差。我们的宏观级消融比较了 Qwen3 Transformer 块中 17 个位置的卷积,并找到了在注意力计算之前将卷积应用于投影查询、键和值时的最佳结果。随后的微观研究倾向于使用内核大小 $k=3$ 的残差逐通道卷积,无需额外的归一化或激活。在 Qwen3 模型和多个 预训练 数据预算中,此设计提高了七个下游基准的平均准确度,同时添加了不到 0.01\%$ 的参数。表征级案例研究进一步表明,卷积使得重复的标记 ID 对它们的直接上下文更加敏感。这些结果支持逐通道卷积作为自注意力的轻量级补充,用于建模短程词元交互。