论文

可控口语对话生成:针对 K-12 非英语母语学习者的 LLM 驱动的评分系统

Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

模型训练强化学习

摘要

由于熟练程度不匹配,大语言模型 (LLM) 通常无法满足非母语环境中 K-12 英语学习者的教学需求。为了应对这一广泛的挑战,我们以中国国家课程(CSE)为代表案例,引入了一个以熟练程度为基础的框架,根据学习者的能力调整 LLM 的输出。我们的框架可以通过四层评分系统精确控制词汇复杂性,并得到一整套新资源的支持:分级词汇列表和多轮对话语料库。我们的核心技术贡献是 \textbf{DDPO} 算法,即多样性驱动的策略优化,这是一种基于多轮 GRPO 的方法,旨在保持对话多样性,同时全面优化对话质量。该方法显着优于传统方法,实现了低词汇外率和高多样性,同时增强了会话自然性和教学价值。虽然我们的框架以全面性教育为基础,但其设计具有灵活性,并且可以轻松适应其他教育标准。我们的模型、数据和代码都将开源,为个性化英语口语练习提供可扩展的平台,有效解决 K-12 学习者在非沉浸式环境中面临的独特挑战。