论文

更准确还是更高效?评估本地部署的紧凑开放权重语言模型的数学推理

More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning

模型评测评测方法与指标

摘要

出于隐私、成本和可及性原因,大语言模型日益被部署在本地硬件上。然而,许多评估强调准确率,而较少量化本地运行时与能耗、刻画失效模式,或在受控条件下应用配对统计比较。本文提出一个受控的、有文档记录的程序,用于评估本地托管LLM的数学推理。它结合固定的推理设置、分层的答案抽取与验证、显式的失效模式分类和逐问题的资源测量,并以配对显著性检验和效应量报告准确率。我们在一项初步研究中演示该方法:三个五十亿参数以下的紧凑开放权重模型——Gemma3:4b(Google)、Phi3:3.8b(Microsoft)和Qwen3:4b(Alibaba)——在覆盖八年级数学、微积分I和高等概率与统计的数据集上进行测试。所有模型在同一工作站上通过相同的本地推理服务器运行,使用共享的提示模板、受控设置和每个数据集匹配的问题集。没有单一模型全面占优。Qwen3:4b在两个数据集上最准确,Gemma3:4b在微积分I上最准确;但Gemma3:4b在每个数据集上每瓦时返回的正确答案约为Qwen3:4b的三倍,同时生成的输出token少得多;Qwen3:4b每题需要更多的生成时间、能耗和输出。Phi3:3.8b在所有三个数据集上准确率显著更低;其低抽取失败率表明问题在于答案错误而非输出无法解析,但我们提示可能存在提示格式效应。这些初步发现表明,仅凭准确率不足以作为选择本地模型的依据。