BHARATI:具有子词生育力分析的古典印度语言的形态感知分词器
BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis
摘要
标准子词标记化算法(例如字节对编码 (BPE) 和 SentencePiece)主要在现代语言语料库上进行训练,当应用于古典印度语言时,会产生低效的分段。梵语、泰米尔语和其他古典印度语言表现出粘着形态、多产连读(单词边界的语音融合)以及通用训练数据中缺少的特定领域词汇。本文介绍了 BHARATI,这是一组 SentencePiece BPE 标记器,在涵盖七种语言(英语、印地语、梵语、泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语)的平衡的 781 MB 语料库上进行训练,并为所有语言提供本机脚本支持。我们描述了三个连续的分词器版本:v1(仅限英语和梵文,泰米尔语有损坏的字节回退)、v2(四种语言支持,南方语言有字节级回退)和 v3(完整的七种语言本机子词覆盖)。 Subword 生育率分析表明,v3 平均每个印度知识系统 (IKS) 技术术语有 2.6 个标记,而 GPT-2 标记器每个术语有 5.25 个标记,多语言 SentencePiece 基线有 3.75 个标记,其中通过构造表示为单个标记的一组保留 IKS 术语的增益最大。在 490 个 IKS 域句子(七种语言中每种语言 70 个,与测量脚本一起发布)的保留测试集上,v3 相对于 GPT-2 和字节级编码(缺少本地印度语子词)将序列长度减少了约 90%,相对于 mBART-50 多语言基线减少了约 25%(在六种印度语中平均),直接转化为增加了下游语言模型的有效上下文长度。分词器模型(32,000 个词汇)、训练脚本和评估基准均在开放许可下发布。