论文

利用BART以量规标准多任务微调评估CS1 C++编程作业

Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria

模型训练监督微调与指令调优

摘要

本文研究了用于自动评分 C++ 编程入门作业的 Transformer 模型的标题感知、多任务微调,其目标是生成比通用 LLM 更好地反映教师评分行为的评分预测。使用多学期 CS1 数据,学生提交的内容与数字分数、字母等级桶和作业评分标准配对,然后预处理为统一的序列以用于变压器输入。具有 LoRA 适应能力的 BART 编码器-解码器经过训练,可以联合预测数字成绩和成绩桶,并通过分布匹配项进行增强,以对齐预测和经验成绩分布,这是之前工作中经常忽视的评估维度。实验比较了单任务和多任务训练、硬单热与模糊和基于边界的软标签、评分标准与无评分条件,以及额外的 T5 和成对预训练变体。结果表明,与单任务、硬标签或纯代码基线相比,具有基于边界的软标签和标题上下文的多任务 BART 实现了更低的平均绝对误差和更强的成绩分布对齐。完全微调的 T5 进一步提高了分布保真度,而成对预训练则以少数类别敏感性为代价减少了数值误差。总的来说,研究结果表明,与准确性优化的替代方案相比,具有校准意识、以评分标准为指导的培训能够产生更多类似讲师的评分行为。

利用BART以量规标准多任务微调评估CS1 C++编程作业:论文配图
图 1:RQ1 模型的分布比较