论文

Classroom Final Exam:一个经教师检验的推理基准

Classroom Final Exam: An Instructor-Tested Reasoning Benchmark

模型评测基准与评测资源

摘要

我们引入了 \CFE{} (\textbf{C}lassroom \textbf{F}inal \textbf{E}xam),这是一个多模态基准,用于评估跨 20 多个 STEM 领域的大语言模型的推理能力。 \CFE{} 是根据重复使用的真实大学作业和考试问题以及课程讲师提供的参考解决方案精心策划的。即使对于前沿模型来说,\CFE{} 也面临着巨大的挑战:新发布的 Gemini-3.1-pro-preview 的整体准确率达到了 59.69\%,而第二好的模型 Gemini-3-flash-preview 达到了 55.46\%,还有很大的改进空间。除了排行榜结果之外,我们还通过将参考解决方案分解为推理流程来执行诊断分析。我们发现,虽然前沿模型通常可以正确回答中间子问题,但它们很难在整个多步骤解决方案中可靠地导出和维持正确的中间状态。我们进一步观察到,模型生成的解决方案通常比讲师提供的推理步骤更多,这表明步骤效率不理想,并且错误累积的风险更高。数据和代码可在 https://github.com/Analogy-AI/CFE_Bench 获取。

Classroom Final Exam:一个经教师检验的推理基准
图4:文本子集的样本级诊断。红色曲线表示单元执行准确率。其余曲线表示在单元条件化下的最终答案准确率:Reasoning Prefix 、Reasoning Prefix (Questions Only) 、Single-Unit Injection 与 Single-Unit Injection (Question Only) 。值得注意的是,尽管所有曲线共享相同的 y y 轴刻度,红色曲线度量的是单元级正确性,而其余曲线度量的是最终答案正确性。