论文

僧伽罗-泰米尔电子政务信息检索的查询翻译与跨语言嵌入

Query Translation vs. Cross-Lingual Embeddings for Sinhala-Tamil E-Government Information Retrieval

模型评测模型能力评测

摘要

本文对使用僧伽罗语和泰米尔语查询检索英语政府信息的跨语言信息检索(CLIR)方法进行了比较评估。研究了两种 CLIR 范式:查询翻译 (QT),使用 Google 翻译、NLLB 和 mBART50,以及跨语言嵌入 (CLE),使用 LaBSE、多语言 E5 和 BGE-M3,以单语英语检索作为基线。实验是在经过人工验证的基准上进行的,该基准包括 500 个僧伽罗语、泰米尔语和英语问答对,这些问答对源自斯里兰卡政府信息中心 (GIC) 的 1,699 个分段上下文。使用 Recall@k (k = 1, 3, 5, 10, 15) 评估检索性能。单语检索表现不佳(Recall@15 <10%),而所有 CLIR 方法都大大提高了检索准确性。其中,BGE-M3 实现了最高的 Recall@15,僧伽罗语英语达到 96.2%,泰米尔语英语达到 95.6%,优于最好的 QT 方法(谷歌翻译:92.4% 和 93.0%),同时避免了翻译开销。这些结果表明,多语言嵌入模型为资源匮乏的政府领域中的跨语言检索增强生成(RAG)提供了更有效和可扩展的解决方案。