论文
用大语言模型自动评分Linux/bash考试:四层认知分类法方法
Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach
摘要
命令行考试的可扩展可靠评分仍是计算教育的挑战——入学人数上升使人工阅卷困难——而基于规则的自动评分器无法处理部分得分、等价解法或语法变体。本文评估四个前沿大语言模型(GPT、Claude Opus、Gemini与GLM)能否在评阅简短Linux/bash命令响应时逼近专家判断。该研究采用结合认知复杂度与操作影响的四层认知分类法——从信息检索(L1)与基础文件操作(L2)到结构化操作(L3)与高级系统管理(L4)。模型以两种提示变体测试——最小基线与量规增强版——对象为1200份来自计算机工程专业二年级学生的真实响应——由三位专家教师独立评分。Gemini 3.0 Pro配合量规引导提示取得最高人机一致性(ICC(3,1)=0.888、MAE=0.10、Bland-Altman偏差=-0.014)。一致性随分类层级上升持续下降——高层级差异最大。跨所有模型——量规质量的影响大于提供商选择——结构化提示持续改善一致性。这些结果表明题目复杂度是LLM准确评分难度的可靠预测因子——并建立基于分类法的原则性框架:确定哪些题目适合AI辅助评分、哪些需要人工审查——同时提供可迁移的评估协议与提示模板。
