论文

选择然后求解:范式路由作为 LLM 代理的推理时间优化

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

模型推理推理策略与问题分解

摘要

当基于 LLM 的代理改进任务时,增益是来自模型本身还是来自围绕模型的推理范式?我们通过比较六种推理时间范例(即 Direct、CoT、ReAct、Plan-Execute、Reflection 和 ReCode)来研究这个问题,跨越四个前沿 LLM 和十个基准,产生大约 18,000 次运行。我们发现推理结构对某些任务有显着帮助,但对另一些任务却有害:ReAct 在 GAIA 上比 Direct 提高了 44 个百分点,而 CoT 在 HumanEval 上使性能下降了 15 个百分点。没有单一范式占主导地位,预言机每任务选择平均比最佳固定范式高出 17.1 个百分点。受这种互补性的启发,我们提出了一种选择然后解决的方法:在回答每个任务之前,基于轻量级嵌入的路由器选择最合适的范例。在四种模型中,路由器将平均准确率从 47.6% 提高到 53.1%,比最佳固定范式 50.3% 提高了 2.8 个百分点,并恢复了高达 37% 的预言机差距。相比之下,零样本自路由仅适用于 GPT-5,效率为 67.1%,对于较弱的模型则失败,所有模型都落后于学习到的路由器。我们的结果表明,推理范式选择应该是由学习路由器做出的每个任务决策,而不是固定的架构选择。