论文

重新思考LLM导师中的脚手架:基准与真实学生之间的交互失配

Rethinking Scaffolding in LLM Tutors: The Interactional Mismatch Between Benchmarks and Real-World Deployments

模型评测评测方法与指标

摘要

人工智能导师基准评估的核心教学价值是脚手架:引导学生逐步找到解决方案。然而,将脚手架行为嵌入聊天机器人的调整和评估方法基于一个隐含的假设:学生将拿起脚手架并参与对话。为了检验这一假设是否成立,我们引入了围绕两个指标(聊天机器人支架和学生吸收率)的评估管道,并将它们应用于包含 9,490 个聊天的 9 个数据集,涵盖人工智能导师基准和教育聊天机器人的实际部署。我们的分析表明,虽然基准测试假设了一个高支架、高学生接受度的环境,但现实世界中的学生总体上表现出较低的接受度——经常绕过聊天机器人的教学框架,以很小的人际成本推动互动实现自己的学习目标。我们认为绕过脚手架不一定是有害的;相反,它经常凸显出聊天机器人的教学框架与学生的学习目标之间的不匹配。为了有意义地评估聊天机器人辅助的有效性,未来的基准必须超越学生简单地搭建脚手架的假设,而是评估这些聊天机器人如何驾驭不同的学习环境和学生驱动的交互模式。

重新思考LLM导师中的脚手架:基准与真实学生之间的交互失配:论文配图
图 2:跨 AI 导师基准(上):MathDial、MathTutorBench、QATD2k、PATS 对学生吸收率和聊天机器人支架的每次聊天方式进行评估。带脚手架的聊天机器人(中):CoMTA、RECIPE4U、StemChat。没有脚手架的聊天机器人(下):StudyChat、MathsChat。每个单元格的颜色强度反映了六边形内的聊天数量,学生吸收率(x 轴)为 0.125,聊天机器人支架(y 轴)为 0.29。