论文

PUMA:波兰文化基础多模式理解的基准

PUMA: A Polish Benchmark for Culturally Grounded Multimodal Understanding

模型评测基准与评测资源

摘要

大语言模型 越来越多地超越文本处理,增加对图像和音频等其他模式的支持。虽然文本理解和生成已被广泛研究,但多模式数据处理能力,特别是在英语以外的文化和语言背景下,尚未得到全面评估。在本文中,我们提出了 PUMA(波兰统一多模态评估),这是一个包含 900 个手工任务的新颖基准,旨在探讨波兰文化和语言背景下多模态模型的局限性。该数据集评估了处理文本、图像、音频和视觉丰富文档的文化理解和实践技能。我们对前沿商业模型、开放权重模型和专门的小型系统的广泛评估凸显了显着的性能差距。虽然顶级商业模型在视觉问答方面取得了高分,但大多数模型都难以理解复杂的音频或文档。我们开源评估框架,以推进本地化多模式人工智能研究。