论文
从短视选择到长远意识:用于多轮对话的顺序 LLM 路由
From Myopic Selection to Long-Horizon Awareness: Sequential LLM Routing for Multi-Turn Dialogue
摘要
多轮对话是与 大语言模型 (LLM) 交互的主要形式。虽然 LLM 路由在单轮设置中有效,但由于交互动态和延迟奖励,现有方法无法最大化多轮对话中的累积性能。为了应对这一挑战,我们从短视的单轮选择转向多轮对话的长视野顺序路由。因此,我们提出了 DialRouter,它首先执行 MCTS 来探索由不同 LLM 选择引起的对话分支,并收集具有高累积奖励的轨迹。然后,DialRouter 从搜索衍生的数据中学习轻量级路由策略,并通过基于检索的未来状态近似进行增强,从而无需在线搜索即可实现多轮路由。对开源和闭源 LLM 的不同候选集的开放域和特定域对话任务进行的实验表明,DialRouter 在任务成功率方面显着优于单个 LLM 和现有路由基线,同时在与成本感知奖励相结合时实现了卓越的性能与成本权衡。