论文

K-EXAONE 2.0技术报告

K-EXAONE 2.0 Technical Report

模型训练预训练

摘要

本技术报告介绍了 K-EXAONE 2.0,这是 LG AI Research 开发的开放权重多语言基础模型,是我们迈向全球前沿规模基础模型的一步。我们没有从头开始训练,而是升级了 K-EXAONE 并扩展了其架构,产生了一个混合专家 (MoE) 模型,总参数为 750B,每个词元激活约 37B,是其前身容量的三倍多。 K-EXAONE 2.0 支持高达 256K 词元的上下文长度,并将多语言覆盖范围从六种语言扩展到十种语言。其训练流程结合了持续的 预训练、以难度为中心的中期训练和 后训练,以加强基于韩国社会文化背景的推理、代理编码、多语言能力和安全性。在反映实际使用条件的九个评估类别中,K-EXAONE 2.0 比 K-EXAONE 有所改进,并与开放权重模型保持竞争力,显示出其在代理编码和长上下文理解方面的最大收益以及在长上下文检索和安全性方面最明显的优势。 K-EXAONE 2.0 在 Apache 2.0 许可下发布,使更广泛的人工智能生态系统能够评估、部署、适应和构建,同时标志着我们向全球前沿挑战的开始(而不是终点)。