论文

谁思考得最好取决于给多久预算:LLM评测中的预算依赖排名

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

模型评测模型能力评测

摘要

大语言模型的标准评测假设模型排名在不同推理条件下保持稳定。我们通过在七档(64-4,096)token生成预算——即模型可生成的最大token数——下评测四个模型于三个推理基准(共56,476次推理)来挑战这一假设。我们报告四项发现:(i)3-19%的题目表现出非单调行为(准确率随预算增加而下降),即使在控制截断之后也是如此,且该现象是模型特定的(跨模型重叠:6-14%)。(ii)模型排名在所有基准上跨预算发生反转(p < 0.01,McNemar检验)。(iii)oracle分析揭示模型互补性最高达+27.8个百分点,在受限预算下最为显著。(iv)预算感知路由器跨域捕获14.1%的oracle差距;预算特征在域内有益(+1.6至+5.7个百分点)但是域特定的并损害迁移(-1.2个百分点)。这些结果支持采用预算条件化的评测协议。

谁思考得最好取决于给多久预算:LLM评测中的预算依赖排名:论文配图
图4:GPQA 上全题目与仅停止题目的准确率。左:标准评分(截断视为错误)。右:仅限于每个模型完成其生成的题目的准确率。括号中的数值表示样本量较小(N<30N<30)。黑框标记每个预算下最佳的模型。即使采用仅停止评分,排名在高预算下依然保持。