Arkios:一种从头开始训练的开放双语英语-尼泊尔语语言模型,具有天城文感知分词器
Arkios: An Open Bilingual English-Nepali Language Model Trained From Scratch, with a Devanagari-Aware Tokenizer
摘要
我们展示了 Arkios,一个 1.04B 参数密集的 Transformer,它使用自定义单文件 C/CUDA 训练堆栈和为此项目构建的 Devanagari 感知字节级 BPE 标记器,在 150B 英语-尼泊尔语双语文本标记上从头开始进行预训练。在 ARC-Easy 和 ARC-Challenge 上,Arkios 超过了三个同等大小的开放模型(Pythia-1.4B、TinyLlama-1.1B、OLMo-1B),尽管训练标记少了一个数量级,这可能得益于我们的教育网络文本预训练数据与 ARC 小学科学格式之间的匹配,而不是一般能力优势。我们报告了标准协议下的完整评估结果,包括对早期部分样本估计的修正,以及以低资源语言评估小模型的具体结果:常见评估工具使用的标准多项选择字母提示格式使该模型在尼泊尔语阅读理解上有机会,同时在相同格式的英语上也有机会,这将导致一个幼稚的基准运行得出结论该模型没有尼泊尔语能力,而事实上它有。具体来说,两种语言在字母选择格式中都随机得分(0.240 尼泊尔语,0.236 英语,相对于 0.250 的机会基线),而对答案文本的评分则直接揭示了真正的、有利于英语的理解(0.306 尼泊尔语,0.387 英语)。我们描述了在指令调整期间引入的以清单为条件的工具使用契约,其中只有当工具清单在上下文中声明时才允许工具调用,否则会被抑制,并报告该契约在哪里成立以及在哪里不成立。我们在 Apache-2.0 下发布了基础模型权重和指令调整模型权重。训练代码和一小部分私人来源的尼泊尔语预训练语料库并未发布;从发布的重量中重现报告的数字所需的一切都包含在这里。