论文
STEPGATE:小模型 Agent 的逐步云端升级
Do I Need the Cloud? Uncertainty-Aware Step-Level Handoff for Small Language Model Agents
摘要
小语言模型 (SLM) 作为本地智能体控制器很有吸引力,因为它们减少了远程推理、延迟和部署占用空间,但结构化工具错误可能会导致智能体步骤失败。现有路由器通常在每次查询时选择一个模型。然而,智能体公开了顺序决策点,其难度根据中间观察动态变化。我们提出了 STEPGATE,这是一个不确定性感知的切换框架,它可以对每个本地 SLM 操作进行评分,并有选择地将具有挑战性的步骤升级为更强大的模型。在 52 任务 保留测试 单步 BFCL 派生测试拆分中,Qwen2.5-1.5B/7B 对在 30.8% 升级的情况下达到 82.7% 任务成功率,而仅本地升级和 75.4% 随机升级(使用 33.8% 升级)分别达到 67.3% 和 75.4%。在单独的多轮评估中,STEPGATE 仅使用 30.0% 的云操作即可实现 69.0% 的轨迹成功率和 84.0% 的操作成功率,相比之下,仅使用本地操作、60.0%/78.2% 的随机升级和 57.0%/77.1% 的查询级路由(仅强在 100% 云操作时实现 82.0% 的轨迹成功率)行动)。这些结果表明,步进级升级以匹配的云操作速率弥补了与更强大的 Qwen2.5-7B 后端的大部分性能差距,同时远程传输的 token 更少。然而,我们的评估仅限于一个模型系列、一个更强大的后端和脚本化任务。此外,测试集很小,多轮比较依赖于配对间隔和统计测试,我们的风险等级充当研究注释而不是正式的安全保证。