论文

BEAR-Bench:多模态模型的双语企业和学术推理基准

BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

模型评测基准与评测资源

摘要

虽然多模态 大语言模型 (MLLM) 在视觉理解方面取得了显着进步,但它们推理文本密集的专业文档的能力仍未得到完全评估。现有的基准强调信息提取,需要外部领域知识,或者仅将专业文档作为众多设置之一。他们也主要以英语或汉语为中心,而其他语言,尤其是俄语的代表性严重不足。为了解决这些限制,我们引入了 BEAR-Bench(双语企业和学术推理),这是一个独立的、复杂的英语和俄语基准,包含 1000 个基于文本丰富的商业和科学文档的人工注释问题。我们在 BEAR-Bench 上评估了 16 个专有和开放权重 MLLM,包括 Gemini 3.1 Pro 和 Qwen3.5-397B,并观察到即使是最强大的系统也有明显的空间。最后,我们使用生成的模型输出来比较现有的幻觉检测方法,不仅评估模型在 BEAR-Bench 上失败的频率,还评估识别这些失败的可靠性。