论文

推理算力如何塑造前沿LLM评估

How Inference Compute Shapes Frontier LLM Evaluation

模型评测模型能力评测

摘要

AI评估正转向受益于更长轨迹(涉及工具使用与迭代解题)的更难任务。因此——性能对测试时可用算力的数量与分配(“推理算力”)日益敏感。但许多评估仍在单一限制性预算下报告性能——意味着低分可能反映评估设定而非模型底层能力。为检验——我们在横跨软件工程、数学、医学与网络安全的七个挑战基准上评估至多12个前沿语言模型。我们使用受控设定——组合三种简单推理扩展干预:更大token预算、上下文压缩与重复提交尝试——由模型自身或最小正确性反馈引导。我们发现三个主要结果。第一——更大token预算大幅提升跨多域基准性能——包括网络安全、FrontierMath、Humanity's Last Exam与TerminalBench。第二——随着模型进步——固定预算评估日益低估前沿能力。更新模型在大预算下达到更高性能——解锁更难任务并更可靠地求解。第三——各基准在哪种推理扩展方法最有帮助上不同:重复提交广泛改进性能——但更大token预算、外部反馈与并行尝试的价值因基准而异。总体而言——结果表明基准分数依赖协议。因此我们主张:评估应把能力报告为推理时算力的函数——显式指定协议选择——并在匹配预算下于大共享算力范围比较模型代际——尤其在安全或政策相关设定中。

推理算力如何塑造前沿LLM评估:论文配图
图 1:在七个基准测试上测试的前沿模型的推理缩放曲线和平台位置。(A) 累积性能作为所用词元总数(不包括 LLM 法官词元)的函数,每个基准上每个(模型、基准、条件)一条曲线:实线表示预言机分数反馈,虚线表示无反馈;每个条件包括每个任务 5 个独立的轨迹。这两个网络基准测试仅使用之前在非常相似的 Oracle 评分协议下收集的数据(每个任务 5 个轨迹),并且仅以实线显示。 y 轴报告累积平均分数:HealthBench 的连续分数为 [0,1][0,1],The Last Ones 的部分进度表示为完成的 32 个步骤的比例,否则为二进制 0/1 任务成功。图例按每个提供商内的发布日期时间顺序对模型进行排序。垂直虚线标记了每个基准的典型已发布词元预算(两条线表示典型范围);垂直实线标记了本次评估中施加的词元限制。(B) 每个推理缩放曲线达到稳定状态的词元预算,相对于典型公布的预算和测试范围进行分类:典型之前、典型中(对于具有一系列典型值的基准)、典型之后(典型预算和我们测试的限制之间)或超出测试(测试预算内没有稳定状态)。点代表模型,填充为预言机分数反馈,空为五个主要基准没有反馈;这两个网络基准仅贡献 Oracle 分数反馈点。水平线将 Anthropic(顶部)模型与 OpenAI(底部)模型分开。