论文

从评分到解释:评估基于评分标准的教学质量评估的 SHAP 和 LLM 基本原理

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

模型评测评测方法与指标

摘要

自动评分模型越来越多地用于对复杂的语言表现(包括课堂成绩单)进行基于评分标准的质量评级,但它们通常无法深入了解特定分数产生的原因。我们提出了一个基于评分标准的句子级可解释性的通用框架,该框架将与模型无关的 Shapley 值归因与 大语言模型 (LLM) 生成的基本原理相结合。该框架使用 NCTE 语料库在 CLASS 框架的反馈质量维度上进行实例化,可以对经过微调的预训练语言模型 (PLM) 进行系统比较,并提示 LLM 的评分性能和解释 忠实性。在 6k 个带注释的转录本片段中,经过微调的 PLM 在预测准确性方面优于 LLM,但表现出针对中等分数的标签压缩。基于删除的测试表明,SHAP 识别出可靠地驱动模型预测的句子,通常比 LLM 生成的基本原理产生更大、更连贯的预测偏移。跨模型分析进一步表明,SHAP 属性在架构之间稳健转移,而 LLM 基本原理的影响有限且不一致。总体而言,研究结果表明,SHAP 为基于量规的评分提供了更忠实和可转移的解释,并且所提出的框架为评估高风险教育环境和其他基于量规的语言评估任务中的评分模型及其解释提供了原则基础。