论文

图形机:通过边缘实现更好的预训练

Graph Machine: Towards Better Pretraining via Edges

模型架构新型架构

摘要

我们引入了图机(GM),这是一种维护 $O(n)$ 大小状态并通过稀疏动态路由访问它的架构。与固定大小状态或稀疏但静态路由的方法不同,GM 在其稀疏层中保留了 $O(n)$ 复杂性,而不将潜在可访问的状态大小限制为 $O(1)$。相反,GM 使用边缘——类似指针的对象,通过类似于指针追踪的引用机制进行可微分更新。我们用 GM 稀疏层替换 Qwen3-0.6B 中 75% 的密集 Transformer 层,并在 15.7B 词元上从头开始预训练。由于每个稀疏层中每个 KV 头仅检索 4,096 个词元中的 2 个,因此损失仅略有下降;当值为 4 时,最佳模型略微改善了损失。