论文

BLUEX v2:巴西大学入学考试开放式问题的 LLM 基准测试

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

模型评测基准与评测资源

摘要

尽管 大语言模型 (LLM) 在许多任务中表现出色,但他们的葡萄牙语评估却很少受到关注,特别是对于需要更深入推理和生成能力的开放式、推理性任务。虽然最初的 BLUEX 基准通过巴西大学入学考试的多项选择题解决了葡萄牙语评估数据集的稀缺问题,但它没有涵盖更具挑战性的第二阶段考试,该考试需要自由形式的书面回答。在这项工作中,我们介绍了 BLUEX v2,这是一个源自巴西两所顶尖大学 UNICAMP (Comvest) 和 USP (Fuvest) 第二阶段入学考试的基准,涵盖 2022--2025 年考试。我们的数据集包含 395 个问题,分为 919 个分级子问题,其中 55.7% 的问题包含相关图像(在推理过程中表示为上下文相关图像描述,以便能够跨视觉模型和纯文本模型进行评估)。每个问题都注释有主题领域、官方参考答案、LLM 生成的评分标准和六个认知能力标签。我们使用 LLM 作为法官协议评估 21 个最先进的 LLM。结果显示,各模型的性能分布为 4.92 分(0-10 分制为 4.18-9.10),其中数学推理和图像理解成为最难的能力维度。评估代码、模型输出和数据集可在 https://github.com/TropicAI-Research/BLUEXv2 和 Hugging Face 上公开获取:https://huggingface.co/datasets/Tropic-AI/BLUEX-v2。