论文
为构造性作答设计可靠的LLM辅助量规评分:来自物理考试的证据
Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams
摘要
STEM测评中的学生作答通常是手写的,并混合符号表达式、计算过程和图表,在格式与解读上存在很大差异。尽管这类作答对评估学生推理十分重要,其评分却耗时且容易出现评分者不一致,尤其在需要部分给分时更是如此。大语言模型(LLM)的最新进展使AI辅助评分受到更多关注,但关于量规设计与LLM配置如何影响各表现水平上的可靠性,证据仍然有限。本研究使用GPT-4o检验了本科物理构造性作答AI辅助评分的可靠性。二十份真实的手写考试作答在两轮中由四名教师和AI模型按照具有不同分析粒度的技能型量规进行评分。提示格式与温度设置被系统地变化。总体而言,人与AI在总分上的一致性与人类评分者间信度相当,在高表现与低表现作答上最高,而在涉及部分或模糊推理的中等水平作答上有所下降。逐条标准层面的分析显示,对明确定义的概念性技能的对齐强于对扩展性程序判断的对齐。相比整体性评分,更细粒度、基于检查表的量规提升了一致性。这些发现表明,可靠的AI辅助评分主要取决于清晰、结构良好的量规,提示格式起次要作用,而温度的影响相对有限。更广泛地说,本研究通过技能型量规与受控LLM设置,为在STEM场景中实施可靠的LLM辅助评分提供了可迁移的设计建议。