论文

您的学生没有像您希望的那样使用 LLM

Your Students Don't Use LLMs Like You Wish They Did

模型评测评测方法与指标

摘要

教育 NLP 系统通常使用参与度指标和满意度调查进行评估,这充其量只是满足教学目标的代理。我们引入了六种计算指标,用于自动评估学生与人工智能对话中的教学一致性。我们通过分析来自四门课程的 500 个对话中的 12,650 条消息来验证我们的指标。使用我们的指标,我们发现了一个根本性的偏差:教育工作者设计对话导师是为了持续学习对话,但学生主要使用它们来提取答案。部署环境是使用模式的最强预测因素,其重要性超过了学生的偏好或系统设计:当人工智能工具是可选的时,使用集中在截止日期附近;当融入课程结构时,学生会要求逐字作业问题的解决方案。整个对话评估忽略了这些逐轮模式。我们的指标将使研究人员能够构建教育对话系统来衡量他们是否实现了教学目标。