论文
ScienceArena:在最新科学奥林匹克竞赛中评测大语言模型
ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions
摘要
基准饱和和数据污染越来越模糊前沿LLM中真正的科学推理。我们引入 \textsc{ScienceArena},这是来自物理、化学和生物领域 13 个公共科学竞赛的奥林匹克式基准竞赛,包括 IPhO 和 IChO 2025--2026、IBO 2023、USAPhO 2026 和 USNCO 2025。它的开放式、多步骤问题使用过程信用规则,使得忠实评分变得困难。我们通过专家审核的数字化管道构建 ScienceArena,将官方考试、数据、解决方案和量规转换为由奥林匹克奖牌获得者验证的结构化项目。为了扩大评估范围,超越昂贵的人工评分,我们根据 IPhO 和 IChO 五个模型的存档答案,根据奖牌获得者的基本事实来校准LLM作为评委;两位实力评委的专家总分差距都在一分之内。奖牌获得者的笔记表明,失败通常源于视觉基础、结构保真度和全局问题控制,而不是缺少术语。通过交叉求解评估最近的 14 个LLM,我们发现顶级模型在多项公开国际考试中获得了与奖牌相当的评分,而化学和长期一致性仍然是关键瓶颈。我们提供了一个交互式的\href{https://science-arena.onrender.com/}{demo}。
