论文

JoyAI-LLM Flash:以词元效率推进中型 LLM

JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency

模型训练预训练

摘要

我们推出了 JoyAI-LLM Flash,这是一种高效的专家混合 (MoE) 语言模型,旨在重新定义 50B 以下参数体系中强大性能和词元效率之间的权衡。 JoyAI-LLM Flash 在包含 20 万亿词元的海量语料库上进行预训练,并通过严格的 后训练 管道进一步优化,包括跨不同环境的监督 微调 (SFT)、直接偏好优化 (DPO) 和大规模强化学习 (RL)。为了提高词元效率,JoyAI-LLM Flash策略性地平衡了\emph{思考}和\emph{非思考}认知模式,并引入了FiberPO这种受纤维化理论启发的新型强化学习算法,将信任域维护分解为全局和局部部分,为LLM策略优化提供统一的多尺度稳定性控制。为了增强架构稀疏性,该模型包含 48B 总参数,同时每次前向传递仅激活 2.7B 参数,与同等规模的当代行业领先模型相比,实现了更高的稀疏率。为了进一步提高推理吞吐量,我们采用了联合训练推理协同设计,其中结合了密集多词元预测(MTP)和量化感知训练(QAT)。我们在 Hugging Face 上发布了 JoyAI-LLM-48B-A3B Base 及其训练后变体的检查点,以支持开源社区。