论文
作为多代理路由器的 SLM:渐进式 SFT 和强化学习方法
SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach
摘要
专用检索代理通常比通用搜索提供更高质量的结果,但为给定查询选择最佳代理仍然是一个悬而未决的问题。当前的方法基于推断的主题或意图来路由查询,但是基于意图的选择从根本上是有限的:它不合并来自检索到的内容的信号,并且无法检测主题一致的代理何时产生低相关性结果。我们通过有监督的 微调 训练一个小语言模型来解决这个问题,然后进行强化学习,以联合执行代理选择和下游工具调用的结构化参数生成,使用基于检索相关性和查询代理主题对齐的分层奖励函数。这使得模型能够从检索性能中学习任务相关的代理适用性:哪些代理可以可靠地为哪些查询分布生成高相关性结果,以及何时将查询重定向远离专门的代理,尽管存在表面级主题重叠。在此类代理查询不匹配的目标子集上,经过训练的模型的 NDCG@10 达到 0.918,而仅根据意图进行路由的两个 LLM 基线(Amazon Nova Lite 和 Claude Haiku 4.5)的 NDCG@10 为 0.539 和 0.490。总体而言,它的平均 NDCG@10 为 0.771(比 Nova Lite +0.177,比 Haiku +0.219),平均选择延迟为 120.1 毫秒,比 Nova Lite 减少了 82.4%。