论文

TRIM:多步推理任务中基于定向逐步路由的混合推理

TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks

模型推理测试时计算扩展

摘要

数学问题求解等多步推理任务容易发生级联失败:单个错误步骤即可导致整个解答崩溃。当前的 LLM 路由方法将整个查询分配给某一个模型,把所有推理步骤一视同仁。我们提出 TRIM(Targeted routing in multi-step reasoning tasks),仅把那些可能使解答脱轨的关键步骤路由给更大的模型,而让较小的模型处理常规的后续生成。我们的核心洞见是:定向的步骤级干预能从根本上改变推理效率,因为它把昂贵调用精确限制在更强模型可以阻止级联错误的那些步骤上。TRIM 在步骤级运作:它利用过程奖励模型识别错误步骤,并基于步骤级不确定性与预算约束做出路由决策。我们在 TRIM 内开发了多种路由策略,从简单的基于阈值的策略,到能够权衡长程精度-成本以及步骤级正确性估计不确定性的更具表达力的策略。在 MATH-500 上,即便是最简单的阈值策略也以 5 倍的成本效率超越既有路由方法,而更先进的策略以少 80% 的昂贵模型 token 达到与强大昂贵模型相当的性能。在 AIME 等更难的基准上,TRIM 的成本效率最高提升 6 倍。所有方法都能在数学推理任务间有效泛化,表明步骤级难度是推理的基础特征。

TRIM:多步推理任务中基于定向逐步路由的混合推理
图1:TRIM 双模型设置的示意总览