论文
开放推理语言模型的统一部署感知评估
Unified Deployment-Aware Evaluation of Open Reasoning Language Models
摘要
开放推理语言模型通常在混合样本量、部分标准化提示和以准确性为中心的摘要下进行比较,这使得实际模型选择难以解释。我们对四个基准的七种开放推理语言模型配置进行了统一评估:ARC-Challenge、GSM8K、MATH 1 至 3 级和 TruthfulQA MC1。我们在每个模型-数据集-策略条件的相同 238 个示例子集上测试零样本、思维链 (CoT) 和少样本 CoT 提示,产生具有 84 个条件和 19,992 个评估样本的完整 7 x 4 x 3 设计。除了准确性之外,我们还报告 Wilson 置信区间、延迟、峰值视频随机存取存储器 (VRAM)、加权聚合性能、帕累托有效操作点、提示灵敏度指标和兼容性诊断。具有零样本提示的 Gemma-4-26B-A4B 获得了最高加权分数 0.794。 Gemma-4-E4B 在提示设置方面仍然接近顶部,同时使用显着较低的延迟和内存,使其成为强大的实用操作点。引导程序和配对排列分析表明,领先的配置足够接近,因此部署权衡仍然很重要。我们还发现,提示策略会改变模型排名,而不是统一改变所有模型。基准特定的互补性创造了路由空间,Oracle 任务感知选择器的加权分数达到了 0.825。兼容性诊断表明,一些明显的故障,尤其是 GSM8K 上的 Phi-4-Reasoning,反映了共享评估管道下的鲁棒性和接口依从性问题。这些结果支持一个中心主张:开放模型评估应该被视为一个部署感知的多目标操作点问题,而不是一个单分排行榜练习。