论文
超越流利度:大语言模型 中评估沙特方言和文化能力的基于评分标准的基准
Beyond Fluency: A Rubric-Based Benchmark for Evaluating Saudi Dialect and Cultural Competence in Large Language Models
摘要
大语言模型 越来越多地部署在阿拉伯语市场,但标准基准绝大多数奖励现代标准阿拉伯语 (MSA) 流利程度,而方言和基于文化的能力无法衡量。这种差距是必然的:日常阿拉伯语很大程度上是方言,而方言编码了以 MSA 为中心的评估无法捕获的社会意义。我们为沙特方言提供了一个基于标题的基准,其中包括 31 个专家编写的提示,涵盖惯用语、实用语、词汇和文化嵌入现象,每个提示都与专家建立的 真值 配对。我们的方法将评估分为与模型无关的阶段和特定于模型的阶段,在该阶段中,原子、MECE 肯定标准仅源自 真值,在该阶段中,根据这些标准对四个最先进的系统(Claude Opus 5、Gemini 3.7、GPT-5.6 和 Kimi K3)进行评分,并对其主动引入的错误进行惩罚。在 124 个模型提示评估中,我们在九类分类法下对 466 个错误实例进行了分类。这四个系统聚集在一个狭窄的宏观平均范围内(42.7%-53.1%),没有一个模型超过 55%,并且每个模型都记录至少一个负分提示,这证实沙特方言能力仍然广泛未得到解决。值得注意的是,模棱两可的框架是主要的失败模式(占错误的 37.3%),而彻底的幻觉仅占 11.2%,这表明模型因陈述谎言而失败的次数少于通过扭曲语域和扁平化务实细微差别而失败的次数。我们进一步观察一致性与上限的权衡和模型独特的错误签名。我们发布完整的提示集、基本事实和评分标准,以支持可重复的方言评估。