论文

自动简答评分中的质量条件一致性:中程退化和特定任务适应的影响

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

模型评测鲁棒性、公平性与可信度评测

摘要

自动简答评分 (ASAS) 正在从有判别性、微调的模型转向在少样本设置中使用的 大语言模型 (LLM)。该范例利用了 LLM 广泛的世界知识和易于部署的特点,但有限的特定任务数据可能会减少复杂评分任务的一致性。特别是,它对需要细致入微的解释的部分正确答案的评分的影响仍未得到充分研究。我们研究了不同模型的特定任务适应程度与质量条件评分一致性之间的关系。我们使用数百名学生的回答和生物教育专家提供的 真值 分数,比较了少样本模式下的三个 LLM(GPT-5.2、GPT-4o、Claude Opus 4.5)、基于 BERT 的微调编码器和人类专家在两个开放式生物项目上的情况。结果表明,在整个质量范围内,人与人的一致性最高且稳定。所有人工智能模型在完全正确和完全错误的响应上都表现良好,但在中等范围的响应上表现出显着的退化。这种中等范围的退化取决于特定于任务的适应:在样本很少的小样本 LLM 中最严重,并且随着特定于任务的数据的增加而减少,微调的编码器模型表现最好。这种中等程度的退化可能会导致对理解能力不断发展的学生的反应进行不公平的评估。我们的研究结果强调了质量条件公平的重要性,特别关注中等反应。