论文
TatBLiMP:鞑靼语最小语言对的基准
TatBLiMP: A Benchmark of Linguistic Minimal Pairs for Tatar
摘要
我们推出 TatBLiMP,这是鞑靼语(tt,ISO 639-3 tat)语言最小对的第一个基准,鞑靼语是一种用西里尔文编写的 Qypchaq 突厥语言。据我们所知,这是对任何类型的鞑靼语言模型的首次语法性评估,因为即使是 101 种语言的 MultiBLiMP 也不包含鞑靼语。 TatBLiMP 涵盖 1248 个句子对中的 16 种形态句法现象。每对词素只有一个词素不同,一个符合语法,一个不符合语法。当模型为语法成员分配更高的概率时,它就会传递一对。评分会比较模型已经分配的概率,因此基准测试不需要文本生成和解析器,并且它在基础模型和训练中期检查点上运行。 TatBLiMP 将 TurBLiMP 的现象清单和单语素破坏操作改编为塔塔尔语,并添加了一种塔塔尔语特有的现象,即数字和量词后的裸名词数。每对的语法成员都是鞑靼文学散文中经过证实的句子。不符合语法的成员是通过 apertium-tat 换能器的确定性单语素扰动产生的。每对都经过母语人士的批准。合理性原则支配着构造,因此不符合语法的成员是现实世界中看似合理的错误,而不是任意的损坏。跨越从头开始的鞑靼模型、跨语言适应和前沿多语言大语言模型,该基准跟踪重点是鞑靼训练而不是参数规模。 478M 从头开始的模型和 125M 单语言模型领先接近 0.97,7B 适应跟踪,30-120B 参数的前沿 LLM 下降到 0.80-0.92,轻微调整的多语言模型最弱。我们最后讨论了基准测试的主要限制。它继承的分类法省略了对母语使用者来说最重要的形态音系、元音和谐和辅音同化,我们绘制了一个母语第二层来添加它。