论文
Mimir:大规模多语言概念建模
Mimir: Large-scale Multilingual Concept Modeling
摘要
当前的语言建模方法是围绕标记构建的。文本语料库被分割成标记,并通过对这些标记执行计算来训练模型,例如在给定前面的标记作为上下文的情况下预测下一个标记。这种范式已经成为现代语言建模的标准,特别是考虑到基于词元的架构所获得的出色性能。然而,最近的工作不仅开始质疑语言模型如何处理和理解标记的含义,而且还质疑使用更高级别的粒度是否可以推进研究领域。这引发了概念建模的想法,即直接训练模型进行下一个概念预测而不是下一个标记预测。在这项工作中,我们介绍了 Mimir,一个经过训练的 1.6B 大型概念模型,用于多语言概念理解和生成。我们利用涵盖 46 种语言的大规模多语言 预训练 语料库(38,883,987,240 个句子)以及涵盖总共 35 种语言的大规模多轮多语言指令调优数据集(66,816,428 个句子)。我们针对具有相当数量参数的语言模型广泛评估模型性能。