论文

使用逐步微调的序列到序列进行上下文泰米尔语拼写和语法纠正 Transformer

Contextual Tamil Spelling and Grammar Correction Using Progressively Fine-Tuned Sequence-to-Sequence Transformers

模型训练合成数据

摘要

泰米尔语拼写和语法纠正具有挑战性,因为泰米尔语是一种粘着性低资源语言,具有丰富的言语形态、单词边界复杂的连读(语音转换)规则以及由 247 个不同字母组成的脚本。先前的工作通过基于规则的方法、统计 n-gram 模型、最小编辑距离或使用 Transformer 重新排序器的混合管道来针对单词级表面错误;此类方法无法可靠地处理上下文错误(主谓一致、时态一致性或跨词连读),而这些错误需要句子级别的理解。我们提出了一种端到端的序列到序列的公式,并在涵盖 10 个错误类别的多达 657,720 个噪声干净的泰米尔语句子对的合成语料库上微调 mT5-small 和 mBART-50。两个骨干网都遵循相同的四阶段渐进时间表,每个阶段都针对一个弱点:表面噪声(v2)、上下文语法(v3)、单站点连读(v4)和多站点跨词连读(v5)。在与所有训练数据不相交的 1,000 个句子平衡诊断集上,我们的最佳模型 mBART-50 v5 达到了 69.3% 的 top-1 精确匹配准确度,其中连读精度为 87.5%,主谓一致性为 43.5%。时间表是产生这些收益的原因:一旦引入上下文对,主谓准确率就会从 1.0% 上升到 52.5%,而一旦引入多站点连读对,连读准确率就会从 0% 上升到 87.5%。我们还量化了该文献尚未报道的精确召回权衡:连读召回是在身份准确性方面单调支付的。最后,Tamil-LLaMA-7B-Instruct 在 20.0% 复制基线的情况下达到了 19.0% 零样本和 24.7%,这表明泰米尔语适应的指令模型在没有特定任务监督的情况下不会转移到专门的句子级校正。