论文
古希腊语到现代希腊语机器翻译:LLM 和 NMT 模型的新颖基准和 微调 实验
Ancient Greek to Modern Greek Machine Translation: A Novel Benchmark and Fine-Tuning Experiments on LLMs and NMT Models
摘要
古希腊语 (AG) 到现代希腊语 (MG) 的机器翻译 (MT) 是一项低资源任务,受到缺乏大规模、高质量并行数据的限制。我们通过引入 AG-MG 平行语料库来解决这一差距,这是一种新资源,包含来自文学、历史和圣经文本的 132,481 个句子对齐对。我们提出了一种新颖的语料库创建管道,它将网络抓取的摘录级数据与多阶段句子级对齐和细化过程相结合。我们的方法使用带有 LaBSE 嵌入的 VecAlign,首先对手动对齐的 AG-MG 子集进行微调,然后使用 Gemini 2.5 Flash 进行基于 LLM 的错误/未对齐校正阶段,以确保高对齐质量。此外,我们针对此任务提供了现代 MT 模型的第一个综合基准,评估了跨 NMT 模型(NLLB、M2M100)的三种 微调 策略和希腊语 LLM (Llama-Krikri-8B)。我们的实验表明,微调 比基本模型有了显着改进,性能提高了高达 +10.3 BLEU 点。具体来说,Llama-Krikri-8B 的全参数 微调 实现了最高的整体性能,BLEU 得分为 13.16,而采用 QLoRA 的 M2M100-1.2B 模型则表现出最大的相对增益和极具竞争力的结果。我们的数据集和模型对希腊 NLP 做出了重大贡献。