论文
Classroom Final Exam:一个经教师检验的推理基准
Classroom Final Exam: An Instructor-Tested Reasoning Benchmark
摘要
我们引入了 \CFE{} (\textbf{C}lassroom \textbf{F}inal \textbf{E}xam),这是一个多模态基准,用于评估跨 20 多个 STEM 领域的大语言模型的推理能力。 \CFE{} 是根据重复使用的真实大学作业和考试问题以及课程讲师提供的参考解决方案精心策划的。即使对于前沿模型来说,\CFE{} 也面临着巨大的挑战:新发布的 Gemini-3.1-pro-preview 的整体准确率达到了 59.69\%,而第二好的模型 Gemini-3-flash-preview 达到了 55.46\%,还有很大的改进空间。除了排行榜结果之外,我们还通过将参考解决方案分解为推理流程来执行诊断分析。我们发现,虽然前沿模型通常可以正确回答中间子问题,但它们很难在整个多步骤解决方案中可靠地导出和维持正确的中间状态。我们进一步观察到,模型生成的解决方案通常比讲师提供的推理步骤更多,这表明步骤效率不理想,并且错误累积的风险更高。数据和代码可在 https://github.com/Analogy-AI/CFE_Bench 获取。
