论文
内部路由器:从冻结的大语言模型中激发本地技能路由
The Router Within: Eliciting Native Skill Routing from a Frozen LLM
摘要
技能使大语言模型代理人超越了其参数知识,他们承诺的收益取决于选择正确的代理人。部署的利用路线通过将每个技能的元数据预加载到上下文中来分散代理的注意力并限制库的大小。检索管道将选择移出上下文,但也超出了代理的能力。我们表明,冻结代理 LLM 已经在其自己的前向传递中携带路由信号,并且两个线性映射足以在上下文中没有技能文本的情况下将其读出。 Gavel(冻结的大语言模型的概览和判决)分两步阅读。通过两张地图(唯一训练的参数)一目了然地预测任务和每项技能的中间层状态,并根据一次前向传递在安装时构建的紧凑的每个技能库对整个库进行评分。然后,判决将恢复入围技能的前向传递,并读取模型自身的可能性和是/否判断,并与专家的产品融为一体。经过一次训练,Gavel 可以将零样本转移到三个公共基准和 SkillTraj,这是我们的 372 个模拟智能体轨迹的新基准。在 Qwen3-32B 上,它的性能优于渐进式披露以及添加 1.2B 至 16B 外部参数的检索和重新排序管道,在书面任务上最多可提高 13.4 分,而在部署过程中需要技能时可提高最多 21.9 分。路由准确性随着主干网络的提高而提高,并且在 bash 代理工具中,相同的 32B 比在 Codex 中运行的更大的前沿模型更频繁地触发技能使用的正确技能。