论文

第三类从句遭遇:LLM能否取代语文老师?

Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?

模型评测模型能力评测

摘要

虽然各种组织现在积极鼓励在课堂上使用 LLM,但我们仍然缺乏对这些模型实际执行语言教学学基本任务的严格、系统的评估。本文探讨了最先进的 LLM 是否能够提供语言学习者所需的纠正反馈和方法解释。该研究测试了多个 大语言模型 识别、纠正和解释英语学习者常见错误的能力,通过系统地改变模型参数来调查这些技术调整如何影响输出质量、教学清晰度和一致性,并使用检索增强生成来查询方法数据。该评估采用自动化指标(GLEU、BERTScore)以及人类专家判断来捕获纯粹计算测量所忽略的维度:语言的细微差别、文化敏感性和教学适当性。虽然模型表现出令人印象深刻的表面校正能力,但它们的解释往往缺乏有效语言教学所需的术语和领域知识,这表明当前对人工智能辅助语言学习的热情可能超过了我们对这些系统实际教学能力的理解。