论文

Kimi K3:开放前沿智能

Kimi K3: Open Frontier Intelligence

模型架构Transformer

摘要

我们推出 Kimi K3,一个 2.8T 参数 Mixture-of-Experts 模型,具有 1040 亿个激活参数、原生视觉功能和 100 万个词元上下文窗口。 Kimi K3 基于 Kimi Delta Attention 和 Attention Residuals 构建,可改善序列长度和模型深度上的信息流。与稳定的 LatentMoE(每个词元可有效激活 896 个路由专家中的 16 个)以及改进的训练和数据配方相结合,这些进步使整体扩展效率比 Kimi K2 提高了约 2.5 倍。 后训练 强调跨通用、代理和编码领域以及多个推理努力级别的强化学习,从而实现组合泛化和强大的长期执行。在 2.8T 规模上,Kimi K3 得到了多个领域基础设施进步的支持:KDA 的算法系统协同设计、具有高效内存管理的完美平衡专家并行训练、具有持久执行轨迹和沙箱状态的百万词元代理强化学习以及部署创新。广泛的评估表明,Kimi K3 在长视野编码、代理、知识、推理和视觉任务方面实现了前沿水平的性能。虽然其整体性能仍然落后于最强大的专有模型,即 Claude Fable 5 和 GPT-5.6 Sol,但 Kimi K3 的性能始终优于我们套件中评估的其他开放和专有模型。我们发布了完整的 Kimi K3 模型权重,以促进未来的研究并加速前沿情报的更广泛部署和采用。