论文

并非所有错误都是平等的:后果感知的推理算力分配

Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation

模型推理测试时计算扩展

摘要

现代推理模型可以为不同的任务分配不同数量的测试时间计算,例如思考令牌、模型调用或计算预算。现有的方法通常通过预测的难度来驱动这种分配,并在预计提高准确性的地方花费更多的计算。这隐含地假设所有失败的成本相同,因为准确性目标对每项任务的权重相同。然而,这样的假设在部署中并不成立:日志消息中的拼写错误和损坏生产数据库的迁移都被视为一次基准测试失败,但它们的实际成本却截然不同。为了填补这一空白,我们提出了后果感知的测试时计算分配。我们不是仅通过预测的难度来路由计算,而是使用轻量级预测器从问题文本中估计如果解决不正确,任务的成本有多大。然后,调度程序将后果较高的任务路由到更大的计算层或在相同总预算下更高的思考预算。我们在 SWE-bench Lite 上进行了主要实验,并在 Multi-SWE-bench mini 上评估了跨数据集行为,总共涵盖了 700 个软件工程任务。我们的结果表明,结果和难度在各种注释下近似正交,并且当前的思维模型没有根据结果充分分配计算。此外,我们的仅问题预测器从未将 300 个 SWE 基准任务中的高后果任务错误分类为低后果任务。在匹配的计算预算下,我们的结果感知调度程序相对于难度感知路由,将成本加权损失降低了 22% 至 33%;特别是,优先级感知变体(按边际效用信号缩放的每个任务成本进行路由)跨越了 30%,其可部署的预测器驱动版本保留了超过 90% 的预言机收益。

并非所有错误都是平等的:后果感知的推理算力分配:论文配图
图 1:三种当代思维模型没有充分按结果分配计算。每个面板都总结了一个模型的实际思维长度与我们在 SWE-bench Lite 任务上的结果标签之间的关系。 Qwen3-8B的思维长度与结果不相关(ρ=0.002\rho=0.002)。 Qwen3-VL-8B-Thinking 在其 8192 个词元上限下固定了 99.3%99.3\% 的任务。具有扩展思维的克劳德十四行诗 4.5 显示出统计显着但较弱的结果敏感性 (ρ=0.20\rho=0.20, p=0.008p=0.008, n=171n=171)。在三种不同的分配机制中,没有一种机制表现出足够的结果敏感性来解释本文后面观察到的结果感知路由的收益。