论文

注意作为受挫的同步

Attention as Frustrated Synchronization

模型架构新型架构

摘要

完美同步的振荡器网络不会再进行任何进一步的计算,因此基于同步构建的注意力架构必须将其计算定位在结构化的偏离协议中。我们引入了受挫同步网络(FSN),其词元状态是环面上的相位,其整个价值路径是一个通过谐波和一步延迟学习的复杂耦合内核。从同步文献的意义上来说,内核的每个组件都是令人沮丧的。复杂的相位是静态的 Kuramoto-Sakaguchi 挫败角,带符号的谐波是排斥性的 Daido 分量,而延迟项(将每个词元与其所关注的词元的后继耦合)在代数上与 Kuramoto-Sakaguchi 耦合相同,后者的挫败角是数据自身的转换,因此下一个词元预测是在同步受数据挫败时实现的。在字符级文本和代码上匹配一百万个参数和训练预算时,FSN 的验证损失在每个测量的时期都低于经过调整的 RoPE-SwiGLU Transformer,并且比较在训练基线到收敛时仍然存在:每个 30 时期 enwik8 种子完成低于 Transformer 的收敛 50 时期损失 1.611,并且 FSN 完成五十个纪元的运行收敛于 1.5953 +/- 0.0014。每个前馈块都被平均场耦合替换为学习集体模式的变体,在堆栈中不留下多层感知器,跟踪 Transformer。在自然文本上,不受挫的基础层在每个复制深度都落后于聚合的 Transformer,这在远程复制事件中最差;内核会在每个深度为 4 及以上时扭转赤字。标题比较是在一百万个参数的范围内;规模阶梯通过四百万个参数完成,优势仍然存在,剩余的武器被标记为正在进行中。