论文

策略引导的步级模型路由实现高性价比推理

Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning

模型推理测试时计算扩展

摘要

推理时计算大幅提升了大语言模型(LLM)在难题上的性能,但该策略可能产生高推理成本。一种方案是把中间思维链(CoT)状态路由给不同规模的模型;但既有方法依赖限制性能的手工路由策略,或需要训练在许多应用中不可行的大型过程奖励模型。我们把步级模型路由形式化为受约束的决策问题,通过强化学习训练小型控制策略,结合阈值校准来调节性能-效率权衡。我们在三个数学基准(GSM8K、MATH500与OmniMath)上以开源与闭源模型验证。方法一致改善相对手工方法的准确率-成本权衡,同时取得与需要训练大型过程奖励模型的方法相当的权衡。

策略引导的步级模型路由实现高性价比推理:论文配图
图1:策略引导的步级模型路由示意:小策略按步分配大小模型。