论文
评分需要一个评分标准,而不是智力
Grading Needs a Rubric, Not Intelligence
摘要
当小语言模型根据明确的评分标准进行评分时,可以像更昂贵的模型一样可靠地对开放式考试答案进行评分。我们测试这一主张作为any-to-bench背后的设计原则:前沿模型在摄取时读取一次源文档,以提取每个问题及其标题;然后,成本较低的模型会执行所有重复的分级工作。我们在三个推理努力水平上评估了两个模型系列的六种具有成本效益的模型配置。每种配置回答 24 道开放式考试问题,每种配置还对每张答卷进行 3 次评分,每题得出 3,456 个分数。分数很大程度上取决于评分的答案:答案同一性解释了 95.6% 的分数差异,而评判同一性仅解释了 0.2%。提高作家的推理努力会使得分最多增加 0.143 分满分,而提高法官的推理努力最多会使指定分数增加 0.006 分。作为检查而添加的六名前沿法官会重复这些分数,并且作为评审团不再可靠。然后,两次消融会分解相同问题和答案的标题。在保留官方答案的同时删除其标准和级别并不会改变任何可衡量的内容。删除官方答案也会降低可靠性(ICC 0.888 至 0.628),夸大分数,并使法官的推理努力再次变得重要。标题将评分与法官的智力脱钩,在标题中,官方答案几乎完成了所有工作。我们没有发现在标题锚定评分下存在长度偏好或同族偏好的证据。