论文

KSE-Web:低资源高棉语语义搜索的混合检索和 LLM 辅助查询扩展分析

KSE-Web: An Analysis of Hybrid Retrieval and LLM-Assisted Query Expansion for Low-Resource Khmer Semantic Search

模型评测模型能力评测

摘要

作为一种资源匮乏的语言,高棉语面临着一些检索挑战,包括有限的注释数据、模糊的单词边界、多语言嵌入模型的支持薄弱以及频繁的高棉语-英语混合使用。本文介绍了 KSE-Web,对高棉语语义搜索的混合检索和 LLM 辅助查询扩展进行了分析。我们从大约 17K 候选高棉语标题构建数据集,并在过滤、标准化、重复数据删除和文档长度控制后保留 3K 已清理的全文高棉语文档。该数据集包括 300 个手动审核的用户式高棉搜索查询和经过部分人工验证的银色相关标签。我们使用 Qwen2.5 模型评估字符 n-gram BM25、多语言密集检索、混合 BM25+密集检索和 LLM 辅助查询扩展。实验结果表明,BM25 取得了最强的整体性能,达到了 0.943 Recall 和 0.876 nDCG。混合 BM25+密集检索的性能相当,达到 0.929 召回率和 0.871 nDCG,而单独密集检索的性能较低。 LLM辅助查询扩展并不优于非扩展检索;然而,Qwen2.5-3B 产生的扩展查询结果比 Qwen2.5-0.5B 强得多,这表明 LLM 大小和扩展质量对于低资源高棉语检索很重要。我们的分析进一步表明,直接 LLM 扩展可能会引入主题漂移、通用术语和嘈杂的重新表述,而简单的过滤可能会删除有用的语义线索。这些发现强调了 LLM 辅助高棉语语义搜索检索的潜力和局限性,并为未来具有更强的人工验证注释和高棉语感知检索模型的高棉语检索数据集奠定了基础。数据集和文档将在 github.com/back-kh/KhmerSemantic-Search 上提供。