论文
OMIBench:大视觉语言模型中奥林匹克级多图像推理的基准测试
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
摘要
大型视觉语言模型(LVLM)在奥林匹克级别的推理任务中取得了实质性进展。然而,当前这些模型的奥林匹克级多模态推理基准通常强调单图像分析,而未能利用多个图像的上下文信息。我们推出了 OMIBench,这是一个基准,旨在当所需证据分布在多个图像上时评估奥林匹克级别的推理。它包含来自生物、化学、数学和物理奥林匹克竞赛的问题,以及用于精确和语义答案匹配的手动注释的基本原理和评估协议。通过 OMIBench 上的大量实验,我们观察到现有模型中存在明显的性能差距。即使是最强的 LVLM,例如 Gemini-3-Pro,在基准测试中也只能达到 50% 左右。这些结果使 OMIBench 成为研究和改进 LVLM 中多图像推理的重点资源。