论文

努力思考,而不是聪明思考:推理模型无法跨问题分配测试时间计算

Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

模型评测模型能力评测

摘要

推理语言模型越来越多地使用测试时计算来提高性能,但现有的评估通常一次研究一个问题的计算。然而,当多个问题共享端到端成本或延迟约束时,模型必须决定如何在它们之间分配有限的推理计算。我们引入了一种考试式评估框架来研究这一设置,其中模型必须将一个共享的 词元预算 分配给具有不同难度和分值的问题,以最大化其总分。在几个开放和前沿推理模型中,我们发现模型无法在不同难度和价值的问题上战略性地分配共享预算。模型在很大程度上表现为贪婪的顺序求解器:它们按呈现顺序对问题进行优先级排序,在早期问题上进行前期工作,并且对价值保持不敏感,随着问题数量的增加,这些趋势变得更加明显。明确的规划促使计算更均匀地分布,但不会产生价值或困难意识的优先级。相同的行为模式从数学延伸到代码推理。这些发现将全球预算分配确定为一种独特的能力,传统的每个问题评估无法捕获这种能力,并且仍然是当前推理模型的挑战。