论文

LLM 在标准和方言阿拉伯语对话中的文化基准测试

Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues

模型评测基准与评测资源

摘要

使用捕获丰富文化和方言语境的会话数据集来评估 LLM 中的文化推理存在显着差距。大多数阿拉伯语基准侧重于现代标准阿拉伯语 (MSA) 中的短文本片段,忽略了对话中自然出现的文化细微差别。为了解决这一差距,我们引入了阿拉伯文化对话,这是一个基于文化的对话数据集,涵盖 13 个阿拉伯语国家,包括 MSA 和每个国家各自的方言,涵盖 12 个日常生活主题和 54 个细粒度子主题。我们利用该数据集形成三个基准测试任务:(i) 多项选择文化推理,(ii) MSA 和方言之间的机器翻译,以及 (iii) 方言引导生成。我们的实验表明,MSA 和阿拉伯方言之间的性能差距仍然存在,与 MSA 相比,模型在方言设置中的所有三项任务上的表现都较差。