论文

阿拉伯文化和社会语言学知识的前沿 LLM 基准测试:与人类 SME 真值 的交叉评估框架

Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth

模型评测基准与评测资源

摘要

人类专家评估的成本是在专门的高风险领域部署语言模型的主要瓶颈。这对于阿拉伯社会语言学知识来说尤其严重:可信的评分不仅需要语言流畅性,还需要深厚的文化熟悉度,而这是无法通过表面指标来近似的。我们通过针对两个代表性不足的阿拉伯方言社区(埃及阿拉伯语和伊拉克阿拉伯语)实例的交叉评估框架来解决这个问题。我们贡献了 103 个经过验证的提示评分标准对(70 个埃及语、33 个伊拉克语、53 个文化问题、50 个语言问题),由母语中小企业创作和评分,使用惩罚加权评分标准区分积极内容要求和特定于答案的消极错误标准。三个前沿 LLM 作为目标模型(由人类 SME 在 302 个独特的提示响应对中评分),而五个前沿 LLM 作为自动法官,执行提供者级别的自我评估警卫。将平均绝对偏差 (MAD) 与有符号平均误差相结合的双度量方案可将方向分级偏差与对称噪声分开。在 1,307 名评判评估中:GPT-5.4 是最可靠的评判(MADj = 10.21 pp,符号误差 = -1.12%);五名法官中有四名表现出系统性的宽大处理(+2.01%至+6.56%);对于所有评委来说,文化任务比语言任务更难评分(MAD 差距 1.83-4.78 pp);与伊拉克提示相比,模型在埃及提示上的表现明显优于伊拉克提示。然而,考虑到伊拉克和埃及中小企业之间的宽大程度差异,我们不能仅仅将这种差距归因于模型知识。因此,我们强调研究结果并不假设人类评分者具有相同的宽大程度。在所有样本中,隐性文化推理(要求模型模拟母语者判断而不是依赖词汇验证)成为所有判断模型自动评分的主要失败模式。