论文

大语言模型 在多大程度上理解孟加拉语习语?

To What Extent Do Large Language Models Understand Bangla Idioms?

模型评测基准与评测资源

摘要

惯用表达是自然语言不可或缺的一部分,反映了文化差异,并对计算模型提出了独特的挑战,特别是在资源匮乏的语言中。在本文中,我们提出了第一个大规模孟加拉语习语基准数据集,并辅以用于习语含义识别的综合多项选择题(MCQ)数据集。我们利用零样本和少样本提示策略,对最近的 大语言模型 (LLM) 的三个习语相关任务进行了全面评估:释义、习语跨度检测和含义识别。我们的结果揭示了模型性能的巨大差异,没有一个 LLM 在所有任务中始终优于其他模型。值得注意的是,Phi-4-mini-instruct 擅长释义,Kimi-K2-32b-instruct 擅长跨度检测,Gemini-2.5-flash 擅长意义识别。我们相信,我们的数据集和分析将为指导未来的研究提供宝贵的资源,以提高 LLM 对惯用表达的理解,特别是孟加拉语和其他资源匮乏的语言。