论文

TuringLLM:向物理AI高效扩展基础模型

TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI

摘要

我们推出了 Turing-20B-A2B,这是一种 20B 参数的专家混合语言模型,每个词元激活大约 2B 个参数,专为长上下文和延迟敏感的物理 AI 应用程序而设计。该模型在动态 top-k 配置中采用分位数路由,实现词元自适应专家分配,同时保持平衡的专家利用率和受控的平均计算预算。在部署过程中,我们进一步应用容量受限的路由来提示预填充,以实现更定期、更高效的专家执行,同时在预训练期间保留无丢失路由。 Turing-20B-A2B还采用了混合注意力架构,将闪电注意力与少量全注意力层相结合,以实现高效的长上下文建模。该模型采用渐进式三阶段课程进行预训练,并通过持续预训练将原生上下文长度扩展至 128K,并使用 YaRN 将推理时间进一步扩展至 512K。尽管活动参数预算紧凑,但 Turing-20B-A2B 在基础模型阶段实现了超过 Qwen3-8B Base 并接近 Qwen3.5-9B Base 的整体通用能力,同时保持强大的长上下文性能和有利的预填充延迟扩展。这些结果证明了模型能力、长上下文可扩展性和实际推理效率之间的有效平衡。