论文
MLLM能读懂学生的心思吗?手写数学中多模态错误分析的深入解析
Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math
摘要
评估学生的手写演算过程对个性化教育反馈至关重要,但由于书写风格多样、版面复杂以及解题方法各异,这一任务面临独特的挑战。现有教育NLP主要聚焦于文本作答,忽视了真实手写演算过程固有的复杂性与多模态性。当前的多模态大语言模型(MLLM)擅长视觉推理,但通常采用"考生视角",优先生成正确答案而非诊断学生错误。为弥合这些差距,我们提出了ScratchMath,一个专门用于解释和分类真实手写数学演算中错误的新型基准。我们的数据集包含来自中国中小学生的1,720个数学样本,支持两个关键任务:错误原因解释(ECE)和错误原因分类(ECC),并定义了七种错误类型。该数据集通过严格的人机协作方法进行精细标注,涉及专家标注、复核与验证的多个阶段。我们在ScratchMath上系统评估了16个领先的MLLM,发现其与人类专家相比存在显著性能差距,尤其是在视觉识别和逻辑推理方面。专有模型明显优于开源模型,大型推理模型在错误解释方面展现出强大潜力。所有评估数据和框架均已公开,以促进进一步研究。
