论文
Harmonic:用于高效长上下文语言建模的分层状态空间模型
Harmonic: Hierarchical State Space Models for Efficient Long-Context Language Modeling
摘要
我们提出了 Harmonic,一种用于语言建模的分层状态空间模型(SSM)。该架构以逐渐变慢的时间尺度堆叠三个循环级别;每个级别接收下一级的预测误差作为输入,而不是其原始隐藏状态。在具有相同 词元预算 的 enwiki8 上,Harmonic 在 1K 词元上的性能优于同类 Transformer(28M 参数)+1.4%,在 8K 词元上+6.7%,在 32K 词元上+11.4%(bpt,越低越好)。在每个测试长度上,它的性能均优于 Mamba 0.7--1.8%。在 64K 词元时,Mamba 和 Transformer 在 80GB H100 上都会耗尽内存; Harmonic 训练成功,达到 6.169 bpt。结果在 WikiText-103 上重复(1K--32K 范围内 H-TF 差距 +1.7% 至 +7.2%)。在 1B 参数规模下,用 HarmonicBlock 替换 TinyLlama 1.1B 中的所有注意力层消除了 RoPE 位置编码限制:生成的 Hallamonic 模型在两个独立的干净基准(Lambada 和 Fineweb-edu 保留)上在序列长度 1K--8K 上保持稳定的损失,而 TinyLlama 灾难性地降级超过其 2K 词元 RoPE 限制(差距:+9.4 bpt)在 Lambada 上 seq=8K)。每次前向传递的计算量为 O(L),而注意力的计算量为 O(L^2)。日志:https://github.com/Omibranch/harmonic-logs。