论文
数学任务评估中的时间稳定性与少样本提示
Temporal Stability and Few-Shot Prompting in Math Task Assessment
摘要
随着AI工具日益融入教育场景,其随时间的稳定性以及对提示工程技术的响应程度都成为问题。这项纵向研究聚焦于不同AI工具使用任务分析指南(TAG;Stein & Smith, 1998)对数学任务认知需求进行分类的能力。特别是,研究考察了这种分类能力是否随(1)模型版本随时间更新以及(2)使用示例任务的少样本提示而变化。我们测试了一个通用AI工具(Gemini)和一个教育专用AI工具(Coteach)。之所以选择这些特定工具,是因为它们在相关已发布基准和先前的任务专项测试中表现相对较高。模型在基线时被测试,随模型版本更新被重测,然后再用少样本提示(每个认知需求类别两个示例任务)再次测试。结果显示,仅凭更新的模型版本产生了好坏参半的效应:Gemini的准确率稳定在58%,而Coteach的准确率从75%降至50%。然而,少样本提示提升了两个模型的性能:Gemini升至67%,Coteach恢复到75%的准确率。这些发现表明,提示工程技术可以比被动的模型改进产生更大且更可靠的效果,而且版本更新并不总能提升专门教育任务上的表现。这项研究对教育者和研究者应如何在教育场景中进行AI工具的选择、评估与实施具有重要启示。