论文

ImageEval 2026:基于文化的阿拉伯语多模式评估

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

模型评测基准与评测资源

摘要

我们概述了基于文化的阿拉伯语多模式评估 ImageEval 2026 共享任务。它包括两项任务:(i) AynVQA,涵盖英语和现代标准阿拉伯语 (MSA) 中的口语视觉问答和基于图像的幻觉检测,以及 (ii) CRAI-Bench,评估文本到图像生成的文化准确性。共有14个团队参与测试阶段,其中12个团队提交了系统描述论文。参与系统使用了一系列方法,包括零样本提示、视觉语言模型的 微调、语音识别管道、集成和分数校准。我们描述了任务设置、数据集、评估程序和参与系统,并总结了不同轨道的主要结果。共享任务的所有数据集和评估脚本都会发布给研究社区。共同任务强调了基于文化的多模式评估的挑战,特别是对于阿拉伯语语音和图像文本推理。