SymbolicLight V1:高编码器尖峰稀疏度下的尖峰门控双路径语言建模
SymbolicLight V1: Spike-Gated Dual-Path Language Modeling at High Encoder Spike Sparsity
摘要
本机训练的尖峰语言模型必须在通过稀疏二元激活进行操作时保留跨时间的信息,这种组合相对于密集的 Transformer 产生了持续的质量差距。我们提出了 SymbolicLight V1,这是一种尖峰门控双路径语言模型,它将二进制 Leaky Integrate-and-Fire (LIF) 动态与连续残差流结合起来。其双路径 SparseTCAM 混合器将一阶指数衰减状态与连续残余流上的窗口局部注意力相结合,然后是上下文条件解码头。我们在 3B 词元、10 个领域的中英文语料库上从头开始训练了 4 个 194M 参数的模型。在固定标记加权评估集上,运行达到困惑度 (PPL) 8.88-8.93(平均值 8.904,样本标准差 0.019)。该集合与训练流的分离尚未得到验证。训练时间编码器探针的平均零尖峰分数为 89.96%;这不是整个模型的稀疏性度量。代码词元占该组的 43.7%;十个域 PPL 的未加权平均值为 29.38。在相同的语料库、标记器、词元预算 和硬件下,标记加权平均值比 GPT-2 201M (PPL 8.27) 高 7.7%。在五个零样本基准测试中,两个 200M 规模的模型没有显示出明显的精度差异。在温度 0.7 和 top-k 50 的采样下,SymbolicLight 产生较低的 4 克重复;熵调制规则颠倒了该排名。在 RTX 2080 Ti 上,测得的生成吞吐量为 22.8 与 91.5 词元/秒;生成后功率读数给出的粗略能量估计为 2,848 mJ/token,而没有生成过程中的功率整合。