论文
KCSAT-ML:探索具有全国同类群组人类难度的推理模型
KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty
摘要
数学推理基准已经激增,但大多数缺乏基于实际人类表现的每个项目的难度信号。我们介绍 KCSAT-ML,韩国大学学术能力测试(KCSAT;Suneung)数学的十年(2014-2025):包含 339 项核心集的 664 个问题,包含来自全国数十万考生的官方每项错误率。我们将基准与难度对齐推理增益(DRG)配对:这是一种分数正交指标,询问模型的错误是否集中在人类发现困难的项目上,还是集中在人类发现容易的项目上。它们一起揭示了各种 VLM(以及带有 OCR 的 LLM)的三种模式:(i)在每个模型大小下,低预算精度会崩溃在高人为错误尾部; (ii) 测试时间缩放 (TTS) 使词元使用率与队列错误率大致呈线性关系,而准确率增益则遵循非单调曲线; (iii) 在一个家族中,TTS 在最难的项目上的防垢和对较容易的项目上的过度思考之间切换——同一对准失败的两个方面。通过提出的 DRG 指标,我们发现具有几乎相同准确度的模型可以处于几乎相反的值:一个模型在人类也认为困难的事情上犯了错误,而另一个模型解决了最难的项目,但在人类认为容易的项目上失败了,这是聚合准确度隐藏的一个关键对比。我们的代码和数据集生成器在 https://github.com/naver-ai/KCSAT-ML 上完全开源。