论文
NSMQ 谜语:测验的科学和数学谜语基准 大语言模型
NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models
摘要
大语言模型(LLM)在各种科学教育基准上表现出了良好的表现,展示了其在科学和数学教育中的应用潜力。然而,LLM 往往是在西方世界的科学和数学教育数据集上进行评估,而来自南半球的数据集代表性不足。此外,他们往往有多项选择题,而这些选项很难评估。在这项工作中,我们提出了 NSMQ Riddles,这是来自加纳国家科学和数学测验 (NSMQ) 竞赛的科学和数学谜语的新基准,用于评估 LLM。 NSMQ 是加纳一年一度的高中生电视直播竞赛,汇聚了加纳最聪明的高中生,他们以 2 人一组的形式进行比赛,在五轮、五个阶段中回答生物、化学、物理和数学问题,直至选出当年的获胜团队。 NSMQ 谜语由第 5 轮开始的 11 年谜语问题(n=1.8K)组成,每个谜语至少包含 3 个线索。学生们竞相第一个猜出任何线索的答案,早期的线索是模糊的,但也能获得更多的分数。答案通常是数字、单词或短语,以便自动评估。我们评估了最先进的模型:具有高和低推理设置的封闭模型(GPT-5.4、Gemini 3.1 Pro、Claude Opus 4.6)和开放模型(Kimi-K2.5、DeepSeek-V3.1、GPT-OSS-120B)。我们的评估表明,即使对于最先进的 LLM 来说,该数据集也具有挑战性,它的表现比最好的学生参赛者更差。这项工作为南半球国家的科学和数学推理提供了一个新颖且具有挑战性的基准,以实现 LLM 科学和数学教育能力的真正全球基准。