论文
RSI-Router:不断发展的子任务级 LLM 路由和技能,以实现经济高效的Agent
RSI-Router: Evolving Subtask-Level LLM Routing and Skills for Cost-Efficient Agents
摘要
大语言模型 (LLM) Agent的实际部署需要以可承受的推理成本实现强大的任务性能。对于长期 agentic 任务,可以通过任务内大小型模型协作来改善这种性能与成本的权衡,因为较小的模型即使无法解决整个任务,也可以处理某些阶段。在本文中,我们介绍了 RSI-router,这是一种路由框架,它通过累积经验的递归自我改进来构建子任务级模型作业和特定于模型的技能。每次迭代由四个阶段组成:子任务挖掘从训练轨迹中导出子任务定义和识别规则; Routing Strategy Evolution提出并评估不同的模型分配;特定于模型的技能进化比较路由轨迹和仅大型模型的轨迹,以诊断故障并开发可重用的执行技能;帕累托最优路由器选择使用历史和新生成的路由器更新帕累托群体,同时保留主导路由器作为后续演化的经验。在 DeepSeek-V4.1-Flash 和 Qwen3.5-9B 之间进行路由时,RSI-router 在五个 agentic 基准测试中始终以大约一半的推理成本 (48.3%) 超越仅使用 DeepSeek 的基准。特别是在 ALFWorld、ScienceWorld 和 WebShop 上,推理成本降低了 74.7-82.2%,同时提高了性能;在 Terminal-Bench 2.0 上,它以降低 18.0% 的成本实现了 16.7% 的相对性能提升。此外,RSI-router建立了比9种路由方法更强的性能-成本Pareto边界。