NCP-ArchPreview 技术报告:通过下一个概念预测转向潜在空间语言模型
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
摘要
我们引入了 NCP-ArchPreview,这是一种潜在空间语言模型,它将自回归预训练推向了标准下一个标记预测 (NTP) 的范围。除了 NTP 之外,该模型还通过下一个概念预测 (NCP) 进行学习,以预测跨越多个标记的离散概念,引入明确且更具挑战性的概念级目标,同时保留标准 词元级 自回归生成。 NCP-ArchPreview 通过直接从其隐藏状态构建乘积量化概念词汇表来构建潜在空间,然后通过专用概念模块学习预测未来概念。然后,这些预测的概念被反馈到 词元级 以指导后续生成,并通过 NTP 和 NCP 进行端到端联合训练。我们将该架构扩展到 8.9B 参数,并在 Dolma-3 数据集中的 5.73T 标记上对其进行训练,这标志着迄今为止最大的潜在空间语言模型演示。值得注意的是,NCP-ArchPreview 仅消耗了总训练词元的 51.3%,就实现了 OLMo-3-7B 的最终预训练损失。经过完整的预训练后,它在下游宏观平均值上比 OLMo-3-7B 高 2.45 点,其中在 GSM8K 上显着提高 5.99 点。受控实验隔离了源自潜在架构和 NCP 目标的性能增益的明显进展。此外,NCP-ArchPreview 仅利用 85% 的标准计算,接近严格参数对齐的 8.9B 基线的训练损失。在预训练阶段之后,学习到的潜在空间仍然非常有价值:仅更新 17M 参数的 VQ 模块就可以产生用于域适应的新颖、轻量级接口,而将概念表示简单注入 DFlash2 绘图器中,可以将平均接受长度提高 4.17%,而开销可以忽略不计。