论文
基于 大语言模型 和 Transformer 的跨不同数据集的英语-泰米尔语和泰米尔语-英语机器翻译的系统分析
Systematic Analysis of Large Language Models and Transformer-Based Machine Translation for English-Tamil and Tamil-English Across Diverse Datasets
摘要
泰米尔语等低资源语言的机器翻译面临的挑战主要是由这些语言的并行数据量有限以及它们大量的领域变化和形态复杂性引起的。这项研究对跨多个数据集的英语-泰米尔语和泰米尔语-英语翻译的几种多语言翻译模型的性能进行了综合评估:NTREX、EnTamV2、WikiMatrix 和 PMIndia。本研究使用 BLEU 和 chrF 指标评估监督式 NMT 系统、NLLB 和 mBART,并检查这些系统在不同质量级别和领域的数据上的表现。它执行基于注意力的分析,通过可视化英语源文本及其泰米尔语翻译中标记的对齐来提高模型的可解释性,反之亦然,以深入了解他们如何进行翻译。这项研究还表明,使用上下文提示可以提供一种极好的方法,使用支持泰米尔语的 TamilLaMA 模型执行英语到泰米尔语和泰米尔英语的几次翻译,并将其与有监督的方法进行定性比较。这些发现表明,数据集的质量及其与领域的对齐将极大地影响模型的性能,基于注意力的机制可以帮助解释能力,并且少量的 大语言模型 仍然可以产生结构连贯的泰米尔语翻译。