论文

LiveK12Bench:大型多模态模型真的征服高中水平考试了吗?

LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

模型评测基准与评测资源

摘要

先进的大型多模态模型(LMM)在K-12推理任务中展现出令人印象深刻的性能,作为智能辅导工具前景广阔。实现这一潜力需要模型能够有效应对真实考试,但大多数现有基准无法刻画真实考试环境的复杂性。具体而言,大多数数据集是静态的、容易发生数据污染,且往往局限于受限的模态、学科和评价标准。为解决这些问题,我们提出LiveK12Bench,一个动态、整体、多学科的基准,旨在评估LMM在真实考试场景中的推理能力。LiveK12Bench包含2000多道经过核验的题目,横跨数学、物理、化学和生物,来源于最新的真实考试试卷,并被设计为随时间持续扩充。我们的框架具有若干核心创新:1)自动流水线持续摄取并解析最新试卷以缓解数据泄露;2)提出新颖的“模拟考试(Mock Exam)”评测方案,评估模型以准确且高效的推理路径自主完成端到端考试的能力。在12个LMM上的大量实验表明,先进模型在贴近真实考试的约束下出现显著性能下降:当联合评估过程严谨性与效率时,GPT-5的分数从79分降至53分(满分100)。我们的发现暴露了关键弱点,例如对复杂视觉排版的敏感性,凸显了理想化推理能力与真正教育可用性之间的差距。代码与数据集均已公开。

LiveK12Bench:大型多模态模型真的征服高中水平考试了吗?:论文配图
图2:LiveK12Bench的总体框架。该框架由三个相互关联的模块组成,从原始试卷开始进行多维评估:动态数据构建管道、综合数据集和模拟考试评估协议。