LaTA:符合FERPA的本地LLM自动评分器,即插即用高年级STEM课程作业
LaTA: A Drop-in, FERPA-Compliant Local-LLM Autograder for Upper-Division STEM Coursework
摘要
大语言模型 (LLM) 评分者承诺减轻高年级 STEM 课程的评分负担,但迄今为止大多数部署都将学生作业发送到第三方 API,违反了 FERPA 并使机构面临数据风险,同时需要大量作业修改。我们推出了 $\textbf{LaTA}\ (\textit{LaTeX Teaching Assistant})$,这是一个嵌入式开源自动评分器,完全在商用本地硬件上运行,并采用许多工程和物理课程已采用的 LaTeX 原生工作流程。 LaTA 使用本地托管的开放式思想链 LLM 评分器 (gpt-oss:120b) 实现四阶段管道(摄取、分段、评分、报告),该评分器将学生作业与教师编写的参考解决方案进行比较,并应用带有二进制每个项目评分的 YAML 评分标准。我们于 2026 年冬季在俄勒冈州立大学的 ME 373(机械工程方法)中部署了 LaTA,在单个 Mac Studio 上对大约 200 名学生的每周作业进行评分,每项作业的边际成本为 0 美元,每次提交需要 1--3 分钟的挂钟时间,从而能够对已纠正的作业进行重新评分,并大大扩展了 TA 办公时间的服务。整个学期,教师确认的评分错误率大约为每个评分细目 $0.02$--$0.04\%$。相对于同一位教师之前的传统评分队列,LaTA 评分队列在期中考试中表现优于约 $11\%$,在期末考试中表现优于 $8\%$,并且在每个规定的学习目标上的自我评估信心都有很大提高($N = 159$ 调查回复,$Δ\geq +1.49$ Likert 点,$p < 10^{-27}$ 每次比较)。我们在 AGPLv3 下发布代码。
