论文
面向特定领域的机器翻译和质量评估系统
Toward domain-specific machine translation and quality estimation systems
摘要
机器翻译 (MT) 和质量估计 (QE) 在一般领域中表现良好,但在领域不匹配的情况下性能会下降。本论文研究如何通过一组以数据为中心的贡献,使 MT 和 QE 系统适应专门领域。第2章介绍了一种基于相似性的机器翻译数据选择方法。小型、有针对性的域内子集优于更大的通用数据集,并以较低的计算成本达到较高的翻译质量。第 3 章介绍了一个分阶段的 QE 训练流程,它将领域适应与轻量级数据增强相结合。该方法提高了跨领域、语言和资源设置的性能,包括零样本和跨语言案例。第 4 章研究 微调 中子词标记化和词汇的作用。对齐的标记化词汇设置可以带来稳定的训练和更好的翻译质量,而不匹配的配置会降低性能。第5章提出了一种针对大语言模型的QE引导的上下文学习方法。 QE 模型选择无需更新参数即可提高翻译质量的示例,并且性能优于标准检索方法。该方法还支持无参考设置,减少对单个参考集的依赖。这些结果表明,领域适应取决于数据选择、表示和有效的适应策略。该论文提供了构建在特定领域设置中可靠运行的 MT 和 QE 系统的方法。