论文

量子捷径:复杂的相态动力学减少了序列模型的优化步骤

The Quantum Shortcut: Complex Phase-State Dynamics Reduce the Optimization Steps of Sequence Models

模型架构新型架构

摘要

序列模型通常通过其主干来区分,即跨位置路由信息的机制,例如注意力或循环。本文改变了一个先于主干且几乎所有当前模型都共享的选择:\emph{substrate},其中隐藏状态与从状态到预测的映射形式一起表示的数字系统。普遍的基底是具有仿射-softmax 读数的实值状态;我们研究了一种取自量子理论数学的复值替代方案,其中信息由状态的相位携带,分数是二次玻恩形式。先前的工作证明,该基板的理想化版本在代表性上比任何具有线性读数的真实模型都更强;我们问它是否训练得更快。放宽了阻碍部署的两个属性,即精确统一性和 Born 词汇读出,我们在 Mamba 状态空间模型和基于注意力的 Transformer 中实例化它。在 253M 参数下,匹配在 0.02\%$ 以内,并在一个固定协议下对三字节级语料库进行训练,复杂模型在实际模型的优化步骤的大约三分之一(状态空间)和二分之一(注意力)内达到每个测量到的验证损失。然后两条主干分开。一旦学习率预热结束,状态空间优势继续扩大,在 OpenWebText 上从每个字符 $0.321$ 到 $0.354$ 位,在 FineWeb 上从 $0.368$ 到 $0.396$,这是预热斜坡所无法做到的;相反,每个语料库的注意力优势都会衰减到零,因此这是早期训练的效果。