论文
历史和模型对 LLM 评分的影响:高级软件工程课程的研究
Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses
摘要
研究生水平的研究阅读报告评估给教育工作者带来了巨大的劳动负担。虽然 大语言模型 (LLM) 在自动化学术评分方面具有巨大潜力,但其对这项专门任务的可靠性仍未得到充分研究,特别是在评分一致性方面,缺乏一致性是教育公平的主要障碍。本文提出了一种人性化的 LLM 辅助评分工作流程,并基于研究生高级软件工程课程的 180 名学生提交的材料进行了案例研究。我们从评分一致性和与人类评分的一致性方面评估了两种主流的 LLM Grok 和 GPT。我们发现 LLM 表现出不同程度的模型内一致性和显着的模型间评分不一致,而简单的集成方法无法提高与人类评估的一致性。至关重要的是,连续的交互历史会导致模型评分标准偏离人类专家评分的系统性漂移。我们的研究结果证明了 LLM 在减少研究生教育中教育工作者的评分工作量方面的潜力,同时强调不加区别的 LLM 评分可能会引入系统性不公平,这表明需要具体的操作实践来减轻这种差异。