论文
LLM对初中和高中科学主题理解的基准
A Benchmark for LLM's Understanding of Middle School and High School Science Topics
摘要
大语言模型 (LLM) 越来越多地融入教育环境,但教育工作者缺乏强大的、符合标准的工具来评估其在 K-12 科学环境中的有效性。现有的基准主要评估通用语言或高级科学推理,在理解LLM在与中学科学课程直接相关的内容方面的表现方面存在严重差距。为了解决这一差距,我们使用严格的合成数据管道、多评审验证和项目级心理测量分析,为初中和高中科学开发了一个全面的 NGSS 一致基准。使用此基准对九个开放权重LLM进行了系统评估,表明几个较小的、可本地部署的模型在不同的科学领域和问题类型中实现了高精度。我们的研究结果表明,模型大小并不能一致地预测性能,这强调了有意识的模型选择对于教育部署的重要性。然后,我们将一名人工审核员纳入循环中,审核LLM生成的项目是否与 NGSS 标准保持一致。人工审查表明,综合生成的项目与 NGSS 标准并不完全一致,这表明人机循环项目开发的好处、探索内容和教学知识交叉点的需要,以及扩展基准以评估LLM在教育场景中进行交互式、基于证据的反馈能力的需要。