论文

SemEval-2026 任务 7:跨不同语言和文化的日常知识

SemEval-2026 Task 7: Everyday Knowledge Across Diverse Languages and Cultures

模型评测基准与评测资源

摘要

我们提出了评估 LLM 和 NLP 系统跨多种语言和文化的适应性的共同任务。任务数据由我们手动构建的 BLEnD 基准的扩展版本 (Myung et al. 2024) 组成,涵盖 30 多个语言-文化对,主要代表跨多个大陆的低资源语言。由于该任务是严格为评估而设计的,因此参与者不得将数据用于训练、微调、小样本学习或任何其他形式的模型修改。我们的任务包括两个轨道:(a) 简答题 (SAQ) 和 (b) 多项选择题 (MCQ)。参与者被要求预测标签,并被允许提交任何 NLP 系统并采用不同的建模策略,前提是基准仅用于评估。该任务吸引了 140 多名注册参与者,我们收到了 62 个团队的最终提交材料以及 19 篇系统描述论文。我们报告结果并对性能最佳的系统和最常用的方法进行分析。此外,我们还讨论了对与低资源语言和代表性不足文化中的模型行为的评估、偏差和方法论观点相关的开放性问题和挑战的共同见解。