论文
评估用于翻译错误检测的多语言句子嵌入:英语-希腊语对比研究
Evaluating Multilingual Sentence Embeddings for Translation Error Detection:An English--Greek Contrastive Study
摘要
多语言句子嵌入越来越多地用于估计跨语言的语义相似性,但它们对细粒度翻译错误的敏感性仍然没有得到充分理解。本研究调查通用多语言嵌入模型是否可以区分正确的英语-希腊语翻译和经过最小修改的错误替代方案。对比数据集是根据 FLORES+ 句子对齐参考翻译开发的,并由两位翻译专家审核。它包含 1,850 个示例,涉及 10 个核心错误类别和 5 个探索性错误类别,涵盖事实、词汇语义、语法、关系、指称和话语层面的现象。使用每个英语源句子与其正确和错误的希腊语翻译之间的余弦相似度来评估五种多语言句子嵌入模型(BGE-M3、多语言 E5、多语言 MPNet、LaBSE 和 Jina Embeddings v3)。还评估了无参考 COMETKiwi 模型作为 MT 质量估计基线。通过对比准确性和特定类别敏感性的分数裕度来评估绩效。 BGE-M3 在嵌入模型中实现了最高的准确率,达到 89.30%,而 COMETKiwi 达到了 94.49%。嵌入模型比时态体和代词共指错误更可靠地检测到明确的事实和词汇变化。 COMETKiwi 改进了几个困难类别的性能,包括时态和体、代词和共指以及语义角色错误,但对日期和时间错误的敏感性较低,并且在数字上的嵌入模型表现不佳。结果显示了互补的错误敏感性概况:多语言句子嵌入提供了有用的语义充分性信号,但比作为独立指标更适合作为更广泛的翻译评估框架的组成部分。