论文
超越 N-gram:数据感知 X-GRAM 提取,实现高效嵌入参数缩放
Beyond N-gram: Data-Aware X-GRAM Extraction for Efficient Embedding Parameter Scaling
摘要
大型词元索引查找表提供了计算解耦的扩展路径,但其实际收益通常受到较差的参数效率和快速的内存增长的限制。我们将这些限制归因于 Zipfian 的长尾训练不足、跨层的异构需求以及产生冗余嵌入的“时隙崩溃”。为了解决这个问题,我们提出了 X-GRAM,一种频率感知的动态词元注入框架。 X-GRAM 采用混合散列和别名混合来压缩尾部,同时保留头部容量,并通过归一化 SwiGLU ShortConv 细化检索到的向量以提取不同的局部 n-gram 特征。使用深度感知门控将这些信号集成到注意力价值流和层间残差中,从而有效地将静态记忆与动态上下文对齐。此设计引入了以内存为中心的缩放轴,可将模型容量与 FLOP 解耦。在 0.73B 和 1.15B 尺度上的广泛评估表明,X-GRAM 在 50% 配置中使用小得多的表时,平均准确率比普通骨干网提高了 4.4 个点,比强检索基线提高了 3.2 个点。总体而言,通过高效的内存管理将容量与计算解耦,X-GRAM 为未来的内存增强架构提供了可扩展且实用的范例。代码可在 https://github.com/Longyichen/X-gram 获取。