论文
AI工具能否改造低需求数学任务?任务修改能力评估
Can AI Tools Transform Low-Demand Math Tasks? An Evaluation of Task Modification Capabilities
摘要
尽管近期研究已探索AI工具对数学任务质量进行分类的能力(arXiv:2603.03512),但对其提升现有任务质量的能力知之甚少。本研究考察了AI工具能否成功升级低认知需求的数学任务。共测试了十一种工具,包括六种广泛可用的通用AI工具(如ChatGPT和Claude)以及五种面向数学教师的专用工具(如Khanmigo、coteach.ai)。基于Task Analysis Guide框架(Stein & Smith, 1998),我们提示AI工具修改两类不同的低需求数学任务。提示策略旨在模拟有经验的教师可能采取的做法,而非通过大量优化寻找更有效的提示(即乐观的典型结果)。平均而言,AI工具仅取得中等程度的成功:任务只有64%的时候被准确升级,不同AI工具的表现从相当弱(33%)到较为成功(88%)不等。专用工具仅比通用工具略好一些。失败模式既包括「不足」(保持低认知需求),也包括「过头」(将任务提升到过高的目标类别,可能被教师否决)。有趣的是,AI工具能否正确分类任务的认知需求与它能否升级任务之间呈小幅负相关(r = -.35),表明修改任务的能力(生成式任务)与分类任务的能力(基于量规的判断)是两种不同的能力。这些发现对理解AI在课程适配中的潜在作用具有重要意义,并凸显了开发专用方法以支持教师修改教学材料的必要性。