论文

基于结果的教育中手写考试标准级评分的视觉语言模型

Vision-Language Models for Criterion-Level Grading of Handwritten Examinations in Outcome-Based Education

模型评测鲁棒性、公平性与可信度评测

摘要

标准级别的评分将考试成绩与学习成果联系起来,但手动评分会带来工作量和评分者之间的差异。本研究从五个维度评估用于基于结果的手写评估的视觉语言模型 (VLM):准确性、人类一致性、重复运行可靠性、错误集中度和解释质量。使用来自 485 个本科考试答案的 1,982 个标准级记录,我们比较了 Qwen2.5-VL、InternVL3、Pixtral、Donut 基线和级联集成的 20 种配置。评估设置包括零样本提示、少样本提示、部分微调和低秩适应(LoRA)。两名独立教师对所有 291 项测试标准进行了重新评分,为相同的评估材料提供了人类一致基线。采用 LoRA 的 Qwen2.5-VL 的二次加权 Kappa (QWK) 为 0.727,针对检查者的平均绝对误差为 0.435 分,而人类配对 QWK 的平均值为 0.551。这种比较反映了对考官训练分数的校准。对于所有三个指令调整的 VLM,LoRA 的性能优于部分微调,而在具有有效提示分数的每种配置中,几次提示都会减少 QWK。总体可靠性和精确重复性存在差异:组内相关性范围为 0.790 至 0.874,但 50.2-63.6% 的标准在五次抽样运行中改变了分数。与随机屏蔽相比,注意力引导删除没有显示出统计学上的显着优势,并且四位教师审稿人在解释的有效性方面没有达成共识。这些发现强调需要针对特定​​标准进行校准、可重复评分、审查间接错误以及单独验证解释。发布的评估协议支持在教师监督下的标准级评估研究和评分工具。