论文

递归Agentic推理

Recursive Agentic Reasoning

模型推理推理搜索与路径规划

摘要

测试时推理方法(如迭代精炼、分解和重复采样)通常被孤立评估,使它们的增益难以跨模型、基准和评估管线进行比较。我们引入一个统一视角,将这些方法视为对智能体推理轨迹的递归算子:GROW加深单条推理路径;PRUNE分解并重组问题;BRANCH采样替代推理路径并在其中选择。我们在共享测试平台下,以完全相同的提示、token预算和评分代码,将这三个算子与单次思维链基线进行评估。跨五个基准和三个前沿模型,共14个模型-基准设置、49,327个评分项目和151,876次模型调用,BRANCH在全部14个设置中提高准确率,平均提高5.98个百分点,并在12个设置中是表现最佳的算子。相比之下,GROW平均增益2.18分并在两个设置中降低性能,而PRUNE平均提高0.94分。分析表明,BRANCH的优势不仅来自探索多条推理路径,还来自从截断中恢复:其增益与基线空输出、预算耗尽率强相关(r=0.72)。这些结果削弱了不同问题需要在测试时推理算子之间进行路由的假设;在这一抽象层级上,重复分支持续占优。最后,我们表明非配对评估以及把评分管线失败当作模型错误会实质性改变、甚至逆转比较结论,这促使配对评分成为测试时计算评估的标准协议。