论文

TQLite:多 LLM 评审团指导的 蒸馏 用于实时 MQM 翻译质量评估

TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation

摘要

大语言模型 (LLM) 在基于 MQM 的翻译质量 (TQ) 评估方面表现出了令人印象深刻的性能,大型推理模型 (LRM) 的最新进展有望带来更大的改进。然而,大规模部署 LLM 和 LRM 的计算成本都很高,而小语言模型 (SLM)(尽管效率更高)却难以应对评估任务所需的复杂推理。在这项工作中,我们提出了一项广泛的实证研究,在广泛的 TQ 评估设置中对 SLM、LLM 和 LRM 进行基准测试,提供当前情况的全面视图并建立最佳实践。为了解决可扩展性挑战,我们引入了 TQLite,这是一种新颖的 蒸馏 框架,使 SLM 能够接近基于 LRM 的最佳评估器的 MQM 评估性能。我们的方法利用多 LRM 陪审团,通过实用的数据管理技术和跨不同模型面板的评估响应聚合来生成高质量的合成训练数据。我们的结果表明,通过 TQLite 训练的 SLM 实现了强大的 MQM 评估性能,远远超过了标准 SLM 的现成评估能力,为基于 LLM 和 LRM 的评估器提供了可扩展且经济高效的替代方案。