论文
塔吉克语词性标注基准测试:TajPers 并行语料库神经架构的比较研究
Benchmarking POS Tagging for the Tajik Language: A Comparative Study of Neural Architectures on the TajPersParallel Corpus
摘要
本文提出了塔吉克语自动词性(POS)标记任务的第一个基准。尽管多语言语言模型的存在对世界上许多语言表现出高效性,但迄今为止,它们对塔吉克语语法分析的能力仍未得到探索。本研究的目的是通过对经典神经网络架构和现代多语言 Transformer 的系统比较来填补这一空白。实验是在 TajPersParallel 语料库上进行的,这是一个包含大约 44,000 个词典条目的并行词汇资源。由于当前版本的语料库中缺乏成熟的例句,因此该任务是在孤立的词汇单元级别上执行的,这代表了与上下文无关的分类的具有挑战性的情况。该研究比较了以下架构:循环 BiLSTM-CRF 模型以及多语言模型 XLM-RoBERTa(大型)、mBERT、ParsBERT(波斯语)和 ruBERT(俄语),使用参数高效的 微调 方法 LoRA 进行调整。测试结果表明,mBERT + LoRA 模型实现了最佳性能(宏 F1-score = 0.11,加权 F1-score = 0.62)。事实证明,在缺乏句法上下文的情况下,所有模型在解决形态歧义、成功对主要高频类别(“名词”、“形容词”)进行分类,同时对稀有功能词的有效性为零方面都遇到了很大的困难。零样本评估揭示了塔吉克语与波斯语 (ParsBERT) 和俄语 (ruBERT) 在类型上最接近。所获得的成果为塔吉克语自动处理领域的进一步研究和开发奠定了基础。