论文
思考之前的思考:通过元推理扩展Agentic推理
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
摘要
随着Agent处理更长、更复杂的问题,控制执行本身就成为一项任务。运行中的每个步骤都会带来新的控制选择,例如要构建哪些部分工作、是否重新开始或何时停止。我们引入了 Agentic 元推理,这是一种推理时间工具,可以使这些选择成为一个明确且结构化的推理过程。工作人员执行任务级计算,而控制器则巩固运行已建立的内容,探索下一个选项,评估每个选项在剩余预算下的价值,并使用从持久内存中提取的上下文来分派所选工作。在做出决策之间,控制器仅携带运行的紧凑记录,而不是重播其完整历史记录。我们的基线跨越生产编码Agent和研究工具,以及使用相同工人和计算预算津贴的直接控制Agent。在通过程序重构测试长期 Agentic 能力的 ProgramBench 上,GPT-5.5 的元推理达到了 71.5%,而 Codex 为 58.0%; Opus 4.8 达到了 67.2%,而 Claude Code 达到了 65.5%。在其他基准测试中,涵盖抽象推理、多领域长视野推理和证明生成,它比直接控制提高了 3.6 到 4.2 分(三个前沿模型的平均值)。它在直接控制稳定的测试预算范围内不断改进,尽管其开销可能会在小预算下受到损害。工件图分析揭示了早期工作的更多重用、大多数设置中正确解决方案的更高覆盖率以及最终选择的不均匀收益。这些结果表明,随着智能体扩展到更长的运行时间,在结构化控制上花费计算变得更加重要。