论文
使用微调的轻量级语言模型对低资源语言孟加拉语中的书面答案进行语义评分
Semantic Grading of Written Answers in Low-Resource Language Bangla Using a Fine-Tuned Lightweight Language Model
摘要
孟加拉语是世界上使用最广泛的语言之一,但它在教育 NLP 研究中的服务仍然不足。在许多偏远和农村地区,获得合格的学科教师的机会有限,因此书面答案主要是手工评分的,限制了及时和一致的反馈。自动评估具有挑战性,因为语义上正确的响应在表面形式上可能有很大差异。我们提出了一种双语(孟加拉英语)评估系统,专为资源匮乏的教育环境而设计,该系统优先考虑语义正确性而不是词汇重叠。我们的方法对轻量级语言模型进行微调,以使用问题、参考答案和学生答案对每个回答进行评分,从而生成适合课堂部署的数字分数和简洁、基于上下文的反馈。我们还构建了一个合成双语数据集以实现受控训练和评估。在统一协议下评估的专有和开源 LLM 中,我们经过 QLoRA 调整的 Qwen3-8B 通过在综合评估中产生最强的防泄漏反馈 (RoRa = 0.819) 以及在专门的人类研究中与人类评分最一致的一致性 (rho = 0.936,MAE = 0.725) 证实了持续的改进。