论文
SeqRoute:通过离线强化学习实现全局预算感知的顺序 LLM 路由
SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning
摘要
现有的 LLM 路由框架将查询视为独立事件,忽略了受全局计算预算约束的现实世界用户会话的顺序性质。这种不匹配不可避免地导致预算破产:短视的路由策略在早期交互中耗尽了资源,迫使后续且通常更复杂的查询针对不充分的模型。我们引入了 SeqRoute,这是一个框架,它将多轮路由制定为有限水平马尔可夫决策过程,并通过离线强化学习来解决它。通过将剩余预算纳入状态空间并使用保守 Q 学习 (CQL) 进行训练,SeqRoute 学会了延迟满足,以便战略性地为会话后期的高风险回合保留资源。为了克服数据匮乏的问题,我们提出事后预算重新标签(HBR)。该技术回顾性地模拟了不同假设预算下的历史轨迹,将 10,000 个原始会话扩展为 238 万个富含关键破产信号的转换。在部署时,动态 $λ$ 扫描机制可以实现成本质量帕累托前沿的零样本导航,而无需重新训练。广泛的评估表明,SeqRoute 在保持或提高质量的同时将运营成本降低了 6.0-73.5%,并将破产率抑制在 1% 以下,在整个帕累托前沿严格控制行为克隆、预算感知启发法和静态基线。