论文
Wiola 13M,用于参数高效小语言模型的门控螺旋注意力架构
Wiola 13M, a Gated Spiral Attention Architecture for Parameter Efficient Small Language Models
摘要
十到一亿参数范围的小语言模型对于设备推理、快速实验和受控科学研究很有吸引力,但它们中的大多数重复使用标准 Transformer 块,而不适应小规模机制。我们提出了 Wiola,一种仅解码器的语言模型,其新颖性集中在每层组件的三个下降部分。首先,螺旋旋转位置编码通过缓慢增长的每个维度因子来扰乱标准旋转频率,从而使相位轨迹向外扇形,从而在不添加参数的情况下改善长距离辨别。其次,门控螺旋注意力引入了从查询流的因果累积统计中导出的每头内容自适应标量门,以可忽略的成本提供了隐式且可微形式的软头选择。第三,蝴蝶前馈块用乘法交互和块内旁路路径取代了传统的扩展层,匹配四次门控线性单元块的参数计数,同时改善浅堆栈中的梯度流。我们形式化每个组件,导出精确的参数和计算预算,并证明门控注意力在全序列训练和缓存自回归解码之间存在精确且经过数值验证的等价性,因此在推理时不会引入近似值。我们还描述了在标准小故事语料库上完全可重复的训练和评估协议。参考实现作为开源包发布,并提供权重就绪发布支持。