论文
比较验证GPT-4o-mini与教师评分:音乐分析自动评分的稳定性与策略偏差
Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias
摘要
对开放式音乐分析响应进行评分非常耗时,并且需要对和声知识和形式理解进行细致入微的判断。本研究以教师平均分数为基准,评估了 GPT-4o-mini 对于音乐分析论文评分标准的有效性和可重复性。教师对包含 300 名大学水平学生回答的数据集进行了四个维度的评分:和谐、形式、推理和术语。 GPT-4o-mini 使用三种提示策略获得了相同的反应:带有思想链推理的几次提示(Fs+CoT)、检索增强生成(RAG)和基于每次管理五个内部生成的自我一致性(SC)。每个策略执行三次,模型、提示、标题和响应保持不变。单次得分代表操作评分条件,而三轮运行的中值聚合用于检查稳健性。使用相关性、组内相关性、Krippendorff's alpha、二次加权 kappa 和评分误差指数来评估与教师平均分数的一致性。 Fs+CoT 在单次评分和中值聚合方面与教师平均分表现出最强的一致性。 RAG 表现出系统性的高分,而 SC 产生高度可重复的分数,但个人水平的一致性较弱。维度层面的分析表明,不同评分标准的评分表现各不相同,术语的一致性普遍弱于推理。这些发现表明,GPT-4o-mini 可以为复杂的音乐分析响应生成稳定的分数,但提示策略会产生不同的评分曲线。因此,操作使用需要针对特定策略的校准、维度级别的验证以及持续的人工监督。