论文

Sub-3B 开放语言模型在 8 GB 消费级 GPU 上的零样本论文评分能走多远?

How Far Can Sub-3B Open Language Models Go in Zero-Shot Essay Scoring on an 8 GB Consumer GPU?

模型评测模型能力评测

摘要

大型语言模型的零样本论文评分通常通过专有的 API 模型来演示,但在最需要自动评分的环境中,例如公立学校在严格的隐私规则下对数千篇论文进行评分,通常将学生的写作发送到第三方 API 是不可接受的。我们询问,当模型必须是在 FP16 中完全本地运行的低于 3B 的开放模型时,可以在单个 8 GB 消费级 GPU 上的所有八个 ASAP-AES 提示上对来自两个系列的四个指令调整模型(Qwen2.5,0.5B/1.5B/3B,SmolLM2,1.7B)进行对照研究,并使用引导置信区间、Holm 校正配对测试和密钥的部署现实变体进行对照研究,还有多少能力能够生存。设计选择。出现了三个发现。 (i) 在批量最小-最大聚合下,Rubric 分解的提示击败了每个模型的整体提示(尽管 Qwen2.5-3B 在一个提示上显着下降),并且在平均聚合下,两个不相关的家族在 1.5-1.7B 尺度上落在 0.01 以内。 (ii) 将特征分数映射到提示范围对于评分者校准来说是脆弱的:一个模型将特征压缩到一个狭窄的低带(0-10 上的 2-4)并且朴素的平均聚合崩溃,而多特征专业化的最小-最大归一化修复它(宏观 QWK 0.204 到 0.388)并在其统计数据冻结在 30 篇保留论文上时保持在 0.03 以内。 (iii) 在 12 种配置中的 11 种中,签名错误随着论文长度的增加而下降,这与大型大语言模型法官报告的冗长偏见相反;对于校准良好的模型,归一化的标题分解在很大程度上使该斜率变平。我们诚实地锚定结果:最佳局部配置 (0.388) 仍然远低于人类评分者间上限 (0.769) 和仅长度基线 (0.523),因此我们严格将 sub-3B 局部模型定位为形成性的、人工监督的反馈。