论文
测量部分得分鸿沟:针对越南2025凸性评分方案的严格基准
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme
摘要
在人类考试上评估语言模型时,基准通常把每个回答计为对或错并报告整体准确率。这种做法假设部分知识值得按比例给分,而当考试采用非加性评分方案时该假设失效。2025年越南高中毕业考试改革展示了这种替代的代价。在考试的Part II部分,考生每题要判断四个对错陈述。评分是凸性的:正确陈述数对应0、0.10、0.25、0.50或1.00分。答对三个陈述只得0.50分,而非标准准确率指标会给的0.75分。由于Part II占考试10.00分中的4.00分,报告准确率会通过奖励官方明确惩罚的部分知识而夸大分数。我们提出THPT-Ladder,一个包含来自11个科目、21份官方试卷的632道题的基准,完全按照官方给学生评分的方式评分。官方公布超过一百万考生的分数,使我们能把模型直接放进人类群体中比较。在八个模型上,官方评分标准在每道Part II题上比按比例给分少0.020到0.159分。这一差额改变了模型的表面能力。以2025年历史考试上的Qwen3.5-27B为例,0.042分的差额使其在481293名考生中的排名从第90百分位降至第77百分位。模型的准确率不能预测这一惩罚。在Claude Sonnet 5的准确率水平上,不同的错误分布会带来每题0.869到0.932分不等的得分。官方分数取决于正确的陈述如何分组,这意味着标准基准报告的是教育机构不会认证的能力。