论文

StudentBench:AI与人类辅导产生等效的GRE学习收益

StudentBench: AI and human tutoring yield equivalent GRE learning gains

模型评测基准与评测资源

摘要

人工智能为增强人类能力提供了前所未有的机会,然而前沿进展主要集中于提升模型能力。我们提出StudentBench,一套AI教学评测与一个公开平台,能够以超过17.5万条学生-AI消息进行大规模数据收集,用于研究大语言模型(LLM)能否产生与人类辅导等效的学习收益。利用StudentBench,我们测量了2383名接受AI辅导、人类辅导或无辅导的参与者在GRE定量与语文题目上的学习收益。我们确立,就GRE学习收益而言,AI辅导在统计上与专家人类辅导等效(p = .015),且在七个GRE领域中的五个中,表现最好的AI导师平均超越了人类导师。在第二项研究中,专家人类导师通过2028次成对量规评估比较了LLM生成的教案与练习题。两项研究共同清晰区分了AI导师在五个维度的表现:(1)教案规划;(2)练习题创建;(3)会话式教学法;(4)成本;(5)参与度。令人惊讶的是,一个AI导师以低918倍的成本实现了与人类辅导等效的学习收益(p = .044)(每提高一个百分点,AI需0.0052美元,人类为4.81美元)。在GRE定量会话中,更快的AI回复与更多学生消息相关,更多消息与更多正确练习相关,更多正确练习与更大学习收益相关(均p < .002)。StudentBench平台可在该https URL免费访问。

StudentBench:AI与人类辅导产生等效的GRE学习收益:论文配图
图1:不同 GRE 学科领域与辅导方式下的学习效果。A:各领域在人类辅导、AI 辅导(合并所有 AI 导师)和无辅导对照条件下,从前测到后测的平均得分变化,误差线为95% Student-t 置信区间。菱形标出各领域表现最佳的模型,虚线连接各领域最佳 AI 表现;题目数对应每次前测或后测。B:合并数量推理与语言推理后的学习增益及95%区间,n 为各辅导条件下的会话数;虚线表示人类辅导增益的置信区间。插图显示调整后的 AI 与人类差异及90%置信区间落在合并标准差的±0.25等效界限内(p=.015),也落在更严格的±0.20界限内(p=.023)。C:12个 AI 导师在控制前测得分和考试部分后的学习增益,以及95% HC3 区间。附录C给出增益表与全部七个领域的 AI 导师排名。