为什么 SWAVE 可能不能满足您的需求:复值循环语言模型的概念演化回顾
Why SWAVE May Not Be All You Need:A Concept-Evolution Retrospective on Complex-Valued Recurrent Language Models
摘要
SWave 是一个复值循环语言模型(169.26M 参数,D=384,L=16,T=2048),使用 2xH100 NVL 在 FineWeb-Edu 上进行训练。它是围绕三个创始前提而设计的:将语言表示为复杂的波而不是实值数字可以实现更丰富的信息编码;凯莱参数化酉转变提供了防止状态衰变或爆炸的数学保证;并且旋转而不是缩小的隐藏状态可以在任意长的上下文中保持信号完整性。 SWave 的核心经历了三个开发阶段的重大演变。人们发现,共振头在结构上承认虚通道崩溃是全局损失最小值(我们称之为共支配崩溃的故障模式),并被具有来自相位关联内存(PAM)架构的独立实部和虚部嵌入表的未束缚头所取代。这解决了退化最小值问题并实现了稳定的 200,000 步训练(最佳步数 PPL 22.0,第 89,861 步)。事实证明,ComplexNorm 和波传播扫描在所有三个阶段都具有承载能力,并保留在最终架构中。 ProtectGatedScan 被重新定义为一种结构性先验行为,而不是一种学习行为。四个多尺度保留概念在受控评估下没有显示出可测量的改进,并且被发现是非承重的。 ComplexGatedUnit 被参数较少的实值平方 ReLU 通道混合器取代。一旦结构性限制得到解决,辅助训练目标就没有任何好处。该研究得出了余统支配崩溃的正式表征、通过对数空间向后传递实现数值稳定性的并行扫描、用于复值循环训练的六种可转移工程原理,以及用于捕获传统测试套件遗漏的结构分歧的计划到代码可追溯性方法。