论文
ZAYA1-8B技术报告
ZAYA1-8B Technical Report
摘要
我们提出ZAYA1-8B:一个面向推理的混合专家(MoE)模型,700M激活、8B总参,基于Zyphra的MoE++架构。ZAYA1-8B的核心预训练、中间训练与监督微调(SFT)在AMD全栈计算、网络与软件平台上完成。以不足1B的激活参数,ZAYA1-8B在多个高难数学与编码基准上匹敌或超越DeepSeek-R1-0528,并与大得多的开放权重推理模型保持竞争力。ZAYA1-8B从预训练起即面向推理从头训练,采用保答案修剪方案从预训练起纳入推理数据。后训练采用四阶段RL级联:数学与谜题的推理热身;400任务的RLVE-Gym课程;带测试时计算轨迹与源自竞赛编程参考的合成代码环境的数学与代码RL;以及面向聊天与指令遵循的行为RL。我们还引入Markovian RSA:一种测试时计算方法,递归聚合并行推理轨迹,同时只在轮间携带有限长度的推理尾部。在TTC评估中,Markovian RSA把ZAYA1-8B提升到AIME'25的91.9%与HMMT'25的89.6%,而仅携带4K-token尾部,缩小了与Gemini-2.5 Pro、DeepSeek-V3.2、GPT-5-High等大得多的推理模型的差距。
