论文

RLCascadeRouter:基于强化学习的免质量估计器级联路由

RLCascadeRouter: Quality-Estimator-Free Cascade Routing via Reinforcement Learning

AI 基础设施模型网关

摘要

不断增长的大语言模型(LLM)生态为优化性能-成本权衡提供了巨大潜力。然而,模型能力的异质性与推理成本差异使高效路由查询成为一大挑战。现有范式不够灵活:单次路由器在观察响应之前就必须做出承诺,而传统级联虽然可以自适应停止,却遵循固定的模型顺序。级联路由同时移除了这两个限制,它在每次响应后重新考虑是停止还是调用另一个模型。当前方法采用先预测后优化的流水线,估计响应质量与未来模型效用。然而,质量或效用的预测损失并不等价于路由决策损失:更低的预测误差未必带来更好的动作,一个微小的跨界误差就可能颠倒停止或模型选择决策。因此,我们提出RLCascadeRouter,一个免质量估计器框架,把级联路由形式化为马尔可夫决策过程,动作包括停止与模型选择。它使用轨迹回报与优势直接优化性能-成本目标。其级联策略网络为模型选择建模候选模型间的互补性,为停止决策建模剩余动作价值,从而取消了独立的事后响应质量估计器。在十三个LLM、十个LLMRouterBench基准上的评估显示,RLCascadeRouter优于强基线,取得更优的性能-成本权衡。它无需再训练即可纳入未见过的模型,消融研究验证了两个策略组件的作用。

RLCascadeRouter:基于强化学习的免质量估计器级联路由:论文配图
图3:级联策略网络。(a) 互补性编码器(CE)对以状态为条件的动作嵌入进行上下文化处理,并为剩余模型打分。(b) 价值感知停止器(VAS)聚合动作上下文以估计 STOP/CONTINUE 偏好和状态价值。二者的输出构成统一的掩码路由策略。