论文

数学教育数字阴影促进大语言模型的学习:模拟学生和人工智能的数学表现、焦虑和信心

Math Education Digital Shadows for facilitating learning with LLMs: Math performance, anxiety and confidence in simulated students and AIs

模型评测基准与评测资源

摘要

为了增强大语言模型对数学教育的影响,我们需要有关他们的数学能力和不同提示的偏差的数据。为了填补这一空白,我们引入 MEDS(数学教育数字阴影)作为一个数据集,映射大语言模型如何在类似人类和人工智能的条件下推理和报告数学。 MEDS 涉及来自 14 个大语言模型(来自 Mistral、Qwen、DeepSeek、Granite、Phi 和 Grok 等家族)的 28,000 个角色,跟踪人类或人工智能助手。每个记录/影子都包含一组提示以及心理/社会人口学角色元数据和四种类型的数学任务:(i) 公开数学面试,(ii) 三个关于数学认知的心理测量测试及解释,(iii) 捕获数学态度的认知网络,以及 (iv) 18 个高中数学测试题及其推理和置信度分数。 MEDS 与传统的仅分数数学基准不同,因为除了数学能力分数之外,它还集成了自我效能、数学焦虑和认知网络科学的概念。数据验证表明,抽样的大语言模型表现出模式完整性和一致的角色,以及家庭特定的特征,如人类的消极数学态度、逻辑谬误和数学过度自信。 MEDS 将使学习分析专家、认知科学家和更安全的数学人工智能导师的开发人员受益。

数学教育数字阴影促进大语言模型的学习:模拟学生和人工智能的数学表现、焦虑和信心
图 1:MEDS 的提示框架和响应结构的信息图表。