论文

教育中的LLM即裁判:课程锚定的评分管线

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

上下文与知识上下文工程

摘要

生成式AI与大语言模型(LLM)日益应用于问题生成与自动评估。但在高风险考试准备中部署LLM需要的不只是提示工程——它要求把模型输出系统锚定到教育当局发布的授权课程工件与评分指南的软件管线。本文呈现课程锚定、可配置的LLM即裁判逐题评分管线——与产业伙伴共同开发——支持大学入学考试准备。该管线识别题目的相关主题、子主题与认知需求——组装可验证的授权上下文以支撑LLM判断。课程意图经具体大纲工件操作化:规定动词与成果、表现带描述符、术语表定义与评分指南原则。分阶段LLM工作流先生成题目专属量规——捕捉对表现的结构化期望——再导出并评估用于为学生回答分配分数的评分标准。该设计改进一致性、透明性以及与官方评分实践的对齐。初步评估表明所提LLM即裁判管线交付与人类导师可比的评分结果——同时产出更可追溯到授权课程工件与评分标准的理据。该管线已集成到在线学习平台——早期部署数据为运营使用与人工覆写提供初步洞见。

教育中的LLM即裁判:课程接地的评分管线:论文配图
图 1:标记管道。