论文

Wiola:面向高效小语言模型的架构

The Wiola Architecture for Efficient Small Language Models

模型架构Transformer

摘要

我们提出Wiola:从第一性原理构建的全原创小语言模型(SLM)架构——与GPT、LLaMA、Mistral或Falcon等任何既有模型家族无结构亲缘。Wiola引入五个独立新颖组件:(i) 螺旋旋转位置编码(SRPE)——在三维螺旋流形上嵌入token位置、结合绝对、相对与层级位置信号;(ii) 门控跨层注意力(GCLA)——为每个解码器层提供对前两层压缩摘要的软交叉注意力访问以增强层间连贯性;(iii) 自适应token合并(ATM)——动态合并中间网络层中语义冗余的相邻token以降低注意力复杂度而不丢信息;(iv) 双流前馈(DSFF)——以学习的逐维度门融合的两并行流替代常规MLP;与(v) WiolaRMSNorm——引入逐维度学习偏移向量防止表示坍缩的改进归一化。提供完整数学推导、架构框图、复杂度分析与对GPT-2、LLaMA-2和Mistral的系统比较。Wiola以四个规模(120M、360M、700M与1.5B参数)发布——完全兼容HuggingFace Transformers生态——22项架构单元测试全部通过。

Wiola:面向高效小语言模型的架构:论文配图
图 1:Wiola 解码器层。橙色虚线箭头:注入 GCLA 的先前层的跨层摘要 𝒞(ℓ)\mathcal{C}^{(\ell)}。 ATM 仅在训练期间仅在中间三分之一层中处于活动状态。