论文
通过 NeuralUCB 基于奖励的在线 LLM 路由
Reward-Based Online LLM Routing via NeuralUCB
摘要
本研究调查了 NeuralUCB 在成本感知 大语言模型 (LLM) 路由中的使用。现有的路由方法可以大致分为监督路由方法和部分反馈方法,每种方法在效率和适应性方面都有不同的权衡。我们实现了基于 NeuralUCB 的路由策略,并在模拟在线设置下在 RouterBench 上对其进行了评估。实验结果表明,所提出的方法在效用奖励方面始终优于随机和最小成本基线。与最大质量参考相比,我们的方法在保持有竞争力的奖励的同时显着降低了推理成本。这些研究结果表明,NeuralUCB 是一种有前途的成本感知型 LLM 路由方法,同时也强调了动作辨别和探索中仍然存在的挑战。