论文

ZetaGPT:位置-编码-自由状态-空间-注意力语言模型的参考实现

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

模型架构混合架构

摘要

基于 Transformer 的语言模型依赖于自注意力,其计算是排列等变的,因此缺乏表示词元顺序的内在机制。现有架构通过学习位置嵌入或手工位置编码(例如旋转位置编码(RoPE))显式合并位置信息来解决这一限制,将位置信息视为架构获取的功能而不是模型的固有属性。在追求无位置编码架构的推动下,这项工作探索了一种语言模型架构,该架构集成了因果状态空间方程,以在注意计算之前隐式编码位置信息。具体来说,每个模型块在自注意力之前应用因果状态空间方程,允许循环状态动态将顺序信息编码为词元表示。因此,后续的注意力层对位置感知表示进行操作,而不需要显式的位置编码,同时保留自注意力的表达建模能力。我们提出了 \textsc{ZetaGPT},这是一种紧凑的混合语言模型,专为研究、快速原型设计、算法验证和教育应用而设计。除了所提出的架构之外,\textsc{ZetaGPT} 还提供了一个完全开源的端到端训练管道,包括数据集构建、分词器训练、预训练、监督 微调、来自人类反馈的强化学习 (RLHF) 以及通过纯强化学习进行的思想链 (CoT) 推理。据我们所知,\textsc{ZetaGPT} 是第一个没有显式位置编码的开源小语言模型,并为无位置编码的语言模型的开发和实证研究建立了一个紧凑的、可重复的参考实现。