论文
LPC-SM:用于长上下文语言建模的本地预测编码和稀疏内存
LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling
摘要
当前大多数长上下文语言模型仍然依赖注意力来处理本地交互和远程状态,这使得测试序列建模的替代分解留下的空间相对较小。我们提出了 LPC-SM,一种混合自回归架构,它将本地注意力、持久内存、预测校正和运行时控制分离在同一块内,并且我们使用正交新颖性传输(ONT)来管理慢速内存写入。我们分三个阶段评估 158M 参数模型,涵盖基本语言建模、数学延续和 4096 个词元延续。相对于匹配的固定比率延续,移除 mHC 会将 A 阶段最终 LM 损失从 12.630 提高到 15.127,而自适应稀疏控制将 B 阶段最终 LM 损失从 12.137 提高到 10.787。完整路线在序列长度 4096 处保持稳定,其中阶段 C 以最终 LM 损失 11.582 结束,并将关键交叉熵中的延迟标识符诊断从 14.396 改进到 12.031。总而言之,这些结果表明,长上下文自回归模型可以围绕更广泛的分工进行组织,而不仅仅是注意力。