论文

规模精度:波兰-西里西亚基准和优于开源和商业模型的翻译系统

Precision over Scale: A Polish-Silesian Benchmark and a Translation System Outperforming Open-Source and Commercial Models

模型评测基准与评测资源

摘要

由于标准基准无法捕获有限的数据和强烈的语言变化,方言机器翻译仍然具有挑战性,标准基准通常假设标准化且经过良好编辑的文本。我们使用神经和基于规则的系统研究波兰-西里西亚 MT,对 SiLTT(一种新的 Pol-Szl 测试集)以及已建立的 BOUQuET 和 FLORES 基准进行评估。结果表明,我们的基于规则的系统在 SiLTT 和 BOUQuET 数据集上始终是最强的,并且在精选数据集上进行微调的 TranslateGemma 改进了强大的神经基线,但在方言设置中没有超越基于规则的系统。我们发布了 SiLTT 和我们最好的神经模型来支持进一步的研究。