论文
A.X K2技术报告
A.X K2 Technical Report
摘要
我们推出了 A.X K2,这是一种从头开始训练的 688B 参数混合专家 (MoE) 语言模型,作为 \emph{agentic} 应用程序的高性能基础。它在大约 8.5T token上进行训练(比其前身 A.X K1 少),在更小但更高质量的混合物上进行训练,并具有大幅扩展的代理和软件工程数据,但它仍然比 A.X K1 全面改进,在一些基准测试中提高了 30 个百分点以上,反映出token效率的大幅提升。为了有效地支持长上下文,我们引入了稀疏门控注意力(SGA),它将稀疏注意力与门控注意力相结合,并采用门控范数(GN)来稳定大规模训练。 SGA 通过 \emph{sparse} 索引器预热以 128K 进行本地训练,该预热根据其自身稀疏的 top-$k$ 选择而不是密集的注意力分布来优化索引器,从而使适应成本明显降低:每个查询仅读取 2,048 个位置,但长上下文质量保持不变,并且 A.X K2 在 RULER 上的得分为 94.6,最高可达 256K。 GN 的异常值抑制反过来又使 4 位 NVFP4 服务保持在 FP8 精度的 1 点以内。简单而有效的 Think-Fusion 配方进一步允许用户在单个统一模型中在思维模式和非思维模式之间切换。广泛的评估表明,A.X K2 的性能与强大的开放权重基线相比具有竞争力,在数学和韩语基准上匹配或超过它们。
