论文
语言模型可以从测试时计算中获得多少收益?
How Much Can Language Models Gain from Test-Time Computation?
摘要
测试时计算可以在多大程度上改进语言模型,以及成本是多少?测试时计算扩展被广泛提议作为较大模型的替代品,但现有的比较大多一次评估一个领域,很少将选择费用纳入预算。我们引入了 SELF-POT,这是一个基准和评估框架,用于衡量模型在竞赛数学、竞赛编程和 Agentic 工作流程中的测试时间潜力。 SELF-POT 将静态任务的候选覆盖率与最终准确性分开,跟踪修订中的正确性转换,并在 Agentic 环境中测量协议完成情况以及任务成功情况。在统一预算规则下,它将直接推理与直接预算固定倍数下的并行采样和自我修正进行比较,并以美元为单位对每次模型调用(包括选择和批评)进行收费。此设计支持两种比较:模型从额外推理中获得的增益,以及针对更强模型的额外推理的低成本模型。以 Claude Opus 5.5 Direct 作为参考,在 350 个密封任务上的五个低成本推理模型中,返回取决于领域、选择规则和故障处理。当我们重放保留的编程候选池时,公共示例选择将正确的提交从 500 个计划单元格中的 376 个提高到 453 个,同时节省了跨模型的 12-49% 逻辑 API 成本,并且在判断失败时简单地保留可用候选者可以以不变的成本恢复 61 个提交。在相同的数学池中,使用后备判断会产生 186 个正确提交,而投票则为 182 个,而投票可节省 12-21% 的逻辑 API 成本。这些受控重播显示了选择和失败处理如何改变从相同生成的候选者中实现的收益,并且它们量化了模型判断的边际价值。