论文

较长的推理何时有帮助?通过发现和执行来预测数学推理

When Does Longer Reasoning Help? Predicting Mathematical Reasoning Through Discovery and Execution

模型推理测试时计算扩展

摘要

测试时计算可以改进数学推理,但短期预算运行能否预测数学推理如何通过额外计算进行扩展?我们引入了一个发现-执行(DE)框架,该框架通过策略发现和条件执行的卷积来预测聚合留出缩放曲线。根据独立的短期预算尝试和预言机草图条件运行,该框架估计替代计算分配下沿着留出推理轨迹的累积成功。我们针对 35 个新的奥林匹克问题和 IMO-ProofBench Advanced 中的非几何问题评估了四个模型。在 DE 框架下,接近饱和的执行预测几何缩放,正如在 GPT 模型中观察到的那样。对于 Claude Opus 4.8,与单臂和两臂分配的几何外推法相比,结合测量执行可显着改善留出预测。作为次要应用程序,正规化 DE (R-DE) 决定继续或重新启动产生的平均后悔率低于最佳模型特定回顾策略。总之,这些结果表明,衡量条件执行提供了有关短期预算成功率并不总是能够捕获的较长推理的信息。