论文
大语言模型的数学解题专长与评估表现相关吗?
Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?
摘要
大语言模型(LLM)在数学教育中的应用日益增多,不仅作为解题者,还作为学习者推理的评估者。然而,更强的数学问题求解能力是否与更强的步骤级评估表现相关,目前仍不清楚。本研究使用PROCESSBENCH的GSM8K和MATH子集考察这一关系;PROCESSBENCH是一个用于识别数学推理中最早错误步骤的人工标注基准。我们评估了两种基于LLM的数学辅导智能体设置(分别由GPT-4和GPT-5实例化),让它们在相同的数学题目上执行两项独立任务:求解原始题目,以及通过预测最早错误步骤来评估基准提供的解答。结果显示出一致的模型内模式:在同一模型解对的数学题项上,评估准确率显著高于其解错的题项,且该关联在两个模型和两个数据集上均具有统计显著性。与此同时,评估仍然比直接解题更难,尤其是在含有错误的解答上。这些发现表明,数学解题专长有助于更强的评估表现,但可靠的步骤级诊断还需要步骤跟踪、监控和精确错误定位等额外能力。研究结果对设计和评估用于数学教育形成性评估的AI支持自适应教学系统(AIS)具有启示意义。
