SLMJury:小型语言模型能否像大型语言模型一样进行判断?
SLMJury: Can Small Language Models Judge as Well as Large Ones?
摘要
大语言模型 (LLM) 被广泛用作评估模型输出的判断器,但其高成本、延迟和不透明限制了可扩展性。我们引入了 SLMJury,这是一个用于评估小语言模型 (SLM) 的框架,可作为评判者跨越两种范式:封闭式二进制正确性和开放式质量评分。我们对来自四个模型系列的 16 个 SLM 判断(0.6B-14B 参数)进行了十个基准测试:涵盖数学、科学和一般推理的八个封闭式任务(每个配置 N=64,824 个判断),以及用于总结和对话评分的 SummEval 和 MT-Bench。我们将判断形式化为预算条件函数并研究五个维度。出现了四项发现。 (1) 过度思考效应与领域相关:对于大多数法官来说,快速 10 个标记的判决在数学判断中匹配或击败扩展推理(有帮助的地方为 2-7%),而推理在一般任务中获胜高达 23%。 (2) 领域泛化将模型族分开,数学与一般精度的差距从 10% 以下到近 40% 不等。 (3) 封闭式和开放式评审利用了不同的能力:最佳二元评审 (Phi-4) 在 MT-Bench 上跌至第 9 名,而推理训练模型则颠倒了这一顺序。 (4) 根据 Reflect-Critique-Refine (RCR) 辩论协议,多主体辩论会降低所有测试配置的准确性,而顶级法官则抵制方差 <=0.55% 的 6 个对抗角色。可靠的自动化评估不需要大型专有模型,但没有单一的 SLM 占主导地位。排行榜可在 https://anishh15.github.io/SLMJury/ 获取,我们的框架代码和 pip 包可在 https://github.com/anishh15/SLMJury 和 https://pypi.org/project/slmjury/ 公开获取。