论文
LLM 在真实双标 GCSE 基准上的表现
LLM Performance on a Real, Double-Marked GCSE Benchmark
摘要
我们引入了一个包含 32,534 个双分真实学生对 GCSE 模拟考试(GCSE 是英国国家考试,在 16 岁左右参加)的真实回答的数据集,涵盖五个科目的 328 个问题,其中包括手写作业。我们测试现成的 大语言模型 与审查员的一致程度是否与两位审查员彼此的一致程度相同。我们发现,模型绝大多数都与审查员在各个科目上的共识一致,表现最好的模型与审查员的一致性比审查员彼此之间的一致性更接近。模型在英语论文评分等主观任务以及处理复杂且凌乱的手写数学论文脚本方面取得了高分。检验线附近的一致性是统一的,并且不会因模型尺寸而受到严重歧视,从而提供了经济高效的自动化标记解决方案。