论文

迈向全自动考试评分:使用基础模型对手写答案进行公平意识识别

Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

模型评测模型能力评测

摘要

手工纠正手写考试非常耗时且容易出错,特别是对于大型群体而言,而全数字化考试往往会迫使教学范围缩小到封闭式问题格式。实用的中间立场保留纸质的、以问题为导向的任务,但将与评估相关的答案记录为机器可以读取的表格中的单个大写字母。悬而未决的问题是,这种读数是否能够准确,最重要的是,对于无人监督的评分是否足够公平。早期的自动化方法仅达到约 88%--91% 的识别率——太低了——并且在最重要的情况下失败了:答案放在单元格之外、划掉或用草书书写。我们展示了通用视觉语言基础模型(VLM),它解释页面而不是匹配像素模板,弥补了这一差距。在 61 项匿名考试(3141 个答案位置)的基准测试中,最佳模型的准确率达到 98.4%,远高于之前的基线。至关重要的是,我们将评估集中在公平性上:我们将假阴性(正确答案标记为错误,这对学生不利)与假阳性区分开来,并在上下文中提供参考解决方案的轻量级提示将假阴性率降低至 0.58%。根据一个示范性的评分方案,61 项考试中只有 3 项的评分会较差,所有这些都是通过学生自我审查步骤发现的。因此,大规模全自动、具有公平意识的考试评分是有道理的;我们发布匿名基准以支持可重复性。