论文
推理算力如何塑造前沿LLM评估
How Inference Compute Shapes Frontier LLM Evaluation
摘要
AI评估正转向受益于更长轨迹(涉及工具使用与迭代解题)的更难任务。因此——性能对测试时可用算力的数量与分配(“推理算力”)日益敏感。但许多评估仍在单一限制性预算下报告性能——意味着低分可能反映评估设定而非模型底层能力。为检验——我们在横跨软件工程、数学、医学与网络安全的七个挑战基准上评估至多12个前沿语言模型。我们使用受控设定——组合三种简单推理扩展干预:更大token预算、上下文压缩与重复提交尝试——由模型自身或最小正确性反馈引导。我们发现三个主要结果。第一——更大token预算大幅提升跨多域基准性能——包括网络安全、FrontierMath、Humanity's Last Exam与TerminalBench。第二——随着模型进步——固定预算评估日益低估前沿能力。更新模型在大预算下达到更高性能——解锁更难任务并更可靠地求解。第三——各基准在哪种推理扩展方法最有帮助上不同:重复提交广泛改进性能——但更大token预算、外部反馈与并行尝试的价值因基准而异。总体而言——结果表明基准分数依赖协议。因此我们主张:评估应把能力报告为推理时算力的函数——显式指定协议选择——并在匹配预算下于大共享算力范围比较模型代际——尤其在安全或政策相关设定中。
