论文

评估德拉威语言的专用单语和联合多语言因果模型

Evaluating Dedicated Monolingual and Joint Multilingual Causal Models for Dravidian Languages

模型评测模型能力评测

摘要

德拉威语言(主要是泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语)仅占用于训练多语言语言模型的数据的一小部分,因此尚不清楚这些模型实际上保留了多少每种语言的能力。我从头开始训练了五个 GPT-2 架构模型,以将四个单语言模型(泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语各一个,每个模型都有自己的 32K 词汇量子词标记器)与一个跨所有四种语言共享 64K 词汇量子词标记器的多语言模型进行比较。所有 5 个模型均使用经过清理的 CC-100、维基百科和 Samanantar 数据进行训练。我已经测试了模型的困惑度、每字节位数、分词器效率以及与 mGPT 进行比较的 微调 结果。单语言模型在情感分类和命名实体识别方面优于 mGPT,并且在所有测试的语言中,它们的标记器被证明比共享多语言模型更有效。