论文

当评分标准发生变化时:批判性思维作文评分的跨评分标准概括

When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

模型训练监督微调与指令调优

摘要

自动论文评分(AES)研究主要集中在交叉提示泛化上,即对来自看不见的提示的论文进行评分,同时评分标准通常保持不变。然而,在实践中,教育工作者可能会在评分任务中修改甚至引入新的评分标准,以评估论文的不同方面。我们研究跨标题泛化:对一组标题下标记的论文进行训练,并对以前未见过的标题进行评估,这些标题针对论文的不同方面。我们使用 大语言模型 (LLM) 微调 框架,该框架具有两个组件:与标题无关的中间表示(称为特征)和训练期间所见标题下的目标论文监督。在添加了多个学生批判性思维技能的评分标准定义标签的 AES 数据集上,我们发现,在最困难的环境中,在训练过程中看不到目标评分标准和目标论文的情况下,特征将宏观 F1 比没有特征的基线提高了 5.0%。我们进一步发现,增加目标论文监督可以提高性能,我们最好的基于 Llama 的开源模型的性能优于 GPT-5-mini 宏 F1 2.1%,落后 GPT-5 1.9%。这些结果表明,基于特征的中间结构和受控监督提高了对未见过的标题的泛化。