论文

当AI遇见幼儿教育:大语言模型作为中国幼儿园的评估队友

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

应用与实践行业应用

摘要

高质量的师生互动 (TCI) 是幼儿发展的基础,但传统的专家评估面临着严峻的可扩展性挑战。在像中国这样的大型系统中(25万多家幼儿园为3600万儿童提供服务),人工观察的成本和时间要求使得持续的质量监控变得不可行,将评估降级为不频繁的间歇性审核,从而限制了及时干预和改进跟踪。在本文中,我们通过提取结构化质量指标并验证其与人类专家判断的一致性来研究人工智能是否可以充当可扩展的评估团队伙伴。我们的贡献包括:(1)TEPE-TCI-370h(追踪有效学前教育),中国学前教育中第一个大规模自然师生互动数据集(370小时,105间教室),具有标准化ECQRS-EC和SSTEW注释; (2) 我们开发了 Interaction2Eval,这是一个基于 LLM 的专门框架,解决特定领域的挑战 - 儿童语音识别、普通话同音词消歧和基于标题的推理 - 达成高达 88% 的一致性; (3) 在 43 个教室进行的部署验证表明,评估工作流程的效率提高了 18 倍,突显了其从年度专家审核转向每月人工智能辅助监测和有针对性的人工监督的潜力。这项工作不仅证明了可扩展的人工智能增强质量评估的技术可行性,而且还为幼儿教育的新范式奠定了基础——持续、包容、人工智能辅助的评估成为系统改进和公平增长的引擎。