论文
LLM不会像人类那样给作文评分
LLMs Do Not Grade Essays Like Humans
摘要
大语言模型近来被提议用作自动作文评分工具,但其与人类评分的一致程度仍不清楚。在这项工作中,我们评估LLM生成的分数与人类评分相比如何,并分析了GPT与Llama家族若干模型在开箱即用、无任务特定训练设定下的评分行为。我们的结果表明,LLM与人类分数之间的一致性仍然相对较弱,且随作文特征而变化。特别是,与人类评分员相比,LLM倾向于给篇幅短或论述单薄的作文打更高分,而给包含轻微语法或拼写错误的长作文打更低分。我们还发现,LLM生成的分数与其生成的反馈大体一致:收到更多表扬的作文往往得分更高,而收到更多批评的作文往往得分更低。这些结果表明,LLM生成的分数与反馈遵循连贯的模式,但所依赖的信号与人类评分员使用的信号不同,导致与人类评分实践的对齐有限。尽管如此,我们的工作表明,LLM生成的反馈与其评分相互一致,并且可以可靠地用于辅助作文评分。
