论文
拉米恩技术报告
Llamion Technical Report
摘要
我们发布了 Llamion,这是一个通过将 Orion-14B 转换为标准化 Llama 系列架构而获得的 14B 参数开放权重语言模型系列。该转换是通过高效知识保存转换(KEPT)来执行的,该方法结合了(i)未更改模块的法线参数映射(NPM),(ii)优化参数映射(OPM),无需训练 LayerNorm-to-RMSNorm初始化,我们证明在权重衰减引起的近零均值激活状态下是最佳的,以及(iii)跨架构知识蒸馏 (XKD),一个同等大小的冻结教师 蒸馏,可在任何合理的输入分布上将转换模型的输出与源模型的输出对齐。 Llamion 在四天内仅用约 1.23 亿词元在单个 A100 上恢复了 Orion 在 H6、MT-Bench 和 KoMMLU 上的行为; Llamion-Base 在 KoMMLU 上的得分达到 66.87%,在提交时比 Open Ko LLM 排行榜的第二名高出了 >7.0 个绝对点。迁移语料库中完全不存在的功能(Python 编程和 200K 词元上下文处理)在架构转换中完好无损。我们发布了三个检查点(Base、Chat、LongChat),这些检查点在 Hugging Face Transformer 库中加载 trust_remote_code=False。