论文

TRACE-BN:将孟加拉英语辅导行为转移到 Sub-1B 离线语言模型

TRACE-BN: Transferring Bangla-English Tutoring Behavior to a Sub-1B Offline Language Model

模型训练合成数据

摘要

孟加拉英语辅导需要的不仅仅是生成正确的翻译:学习者还需要对语法差异的解释、对可能的错误的认识以及有针对性的练习。我们推出了 TRACE-BN,这是一个课程引导的结构化辅导轨迹数据集,适用于 CEFR A1-A2 级别的孟加拉语英语学习者。每条痕迹都结合了单词级注释、字面翻译和自然翻译、孟加拉语语法解释、可能的学习者错误以及有针对性的练习问题及其答案。这些痕迹由 Gemini 3.5 Flash Lite 作为 NCTB 9-10 年级英语课程单元的教师模型生成,然后过滤结构有效性、脚本完整性和语义重复。我们使用 LoRA 和 4 位量化将生成的结构化辅导行为转移到 Qwen3-0.6B,以实现资源受限的离线部署。在保留输入上,模式有效性从 85.4% 提高到 95.8%,而相对于教师模型参考,chrF++ 从 15.28 提高到 34.77,BLEU 从 4.52 提高到 21.03。两名独立评委进行的现场评估显示翻译、语法解释、学习者错误诊断和实践一致性方面的改进,而人工审核则支持监督数据的质量。结果表明,在这些资源约束下,课程引导的结构化监督可以将多成分辅导行为转移到 sub-1B 模型。数据集、模型检查点和代码可在 https://huggingface.co/datasets/RaiyanKhaan/Trace-BN 上公开获取